تكامل mistral.rs
شغل LLMs محليًا باستخدام استدلال Rust الأصلي - لا توجد خوادم خارجية، ولا مفاتيح API.
ما هو mistral.rs؟
mistral.rs هو محرك استدلال Rust عالي الأداء يشغل LLMs مباشرة على جهازك. يدمج ADK-Rust ذلك من خلال كرايت adk-mistralrs، المثبتة على v0.8.0 مع دعم Gemma 4.
أبرز الميزات:
- 🦀 Rust أصلي - لا يوجد Python، ولا خوادم خارجية
- 🔒 غير متصل بالإنترنت بالكامل - لا يتطلب مفاتيح API أو إنترنت
- ⚡ تسريع الأجهزة - CUDA، Metal (3.1 bfloat16)، تحسينات CPU
- 📦 Quantization - ISQ، MXFP4، GGUF، UQFF لتشغيل النماذج الكبيرة على أجهزة محدودة
- 🔧 محولات LoRA - دعم النماذج المضبوطة بدقة مع التبديل السريع
- 👁️ متعدد الوسائط - فهم الرؤية والصوت والفيديو (Gemma 4، Qwen 3 VL)
- 🎤 الكلام - التعرف على الكلام في الوقت الفعلي Voxtral
- 🎯 متعدد النماذج - خدمة نماذج متعددة من مثيل واحد
الخطوة 1: إضافة التبعيات
يتم نشر adk-mistralrs على crates.io كعضو في مساحة العمل. أضفه كاعتماد قياسي:
[package]
name = "my-local-agent"
version = "0.1.0"
edition = "2024"
[dependencies]
adk-mistralrs = "2.0.0"
adk-agent = "2.0.0"
adk-rust = "2.0.0"
tokio = { version = "1", features = ["full"] }
anyhow = "1.0"
لتسريع الأجهزة، أضف علامات الميزات:
# macOS with Apple Silicon
adk-mistralrs = { version = "2.0.0", features = ["metal"] }
# NVIDIA GPU (requires CUDA toolkit)
adk-mistralrs = { version = "2.0.0", features = ["cuda"] }
الخطوة 2: مثال أساسي
قم بتحميل نموذج من HuggingFace وشغله محليًا:
use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{Llm, MistralRsConfig, MistralRsModel, ModelSource};
use adk_rust::Launcher;
use std::sync::Arc;
#[tokio::main]
async fn main() -> anyhow::Result<()> {
// Load model from HuggingFace (downloads on first run)
let config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
.build();
println!("Loading model (this may take a while on first run)...");
let model = MistralRsModel::new(config).await?;
println!("Model loaded: {}", model.name());
// Create agent
let agent = LlmAgentBuilder::new("local_assistant")
.description("Local AI assistant powered by mistral.rs")
.instruction("You are a helpful assistant running locally. Be concise.")
.model(Arc::new(model))
.build()?;
// Run interactive chat
Launcher::new(Arc::new(agent)).run().await?;
Ok(())
}
ماذا يحدث:
- التشغيل الأول يقوم بتنزيل النموذج من HuggingFace (~2-8 جيجابايت حسب النموذج)
- يتم تخزين النموذج مؤقتًا محليًا في
~/.cache/huggingface/ - التشغيلات اللاحقة يتم تحميلها من ذاكرة التخزين المؤقت على الفور
الخطوة 3: تقليل الذاكرة باستخدام Quantization
النماذج الكبيرة تحتاج إلى الكثير من ذاكرة الوصول العشوائي (RAM). استخدم ISQ (In-Situ Quantization) لتقليل الذاكرة:
use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{Llm, MistralRsConfig, MistralRsModel, ModelSource, QuantizationLevel};
use adk_rust::Launcher;
use std::sync::Arc;
#[tokio::main]
async fn main() -> anyhow::Result<()> {
// Load model with 4-bit quantization for reduced memory
let config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
.isq(QuantizationLevel::Q4_0) // 4-bit quantization
.paged_attention(true) // Memory-efficient attention
.build();
println!("Loading quantized model...");
let model = MistralRsModel::new(config).await?;
println!("Model loaded: {}", model.name());
let agent = LlmAgentBuilder::new("quantized_assistant")
.instruction("You are a helpful assistant. Be concise.")
.model(Arc::new(model))
.build()?;
Launcher::new(Arc::new(agent)).run().await?;
Ok(())
}
مستويات Quantization:
| المستوى | تقليل الذاكرة | الجودة | الأفضل لـ |
|---|---|---|---|
Q4_0 | ~75% | جيد | لذاكرة RAM محدودة (8GB) |
Q4_1 | ~70% | أفضل | متوازن |
Q8_0 | ~50% | عالي | يركز على الجودة |
Q8_1 | ~50% | الأعلى | أفضل جودة |
الخطوة 4: LoRA المحولات (النماذج المضبوطة بدقة)
تحميل النماذج باستخدام LoRA المحولات للمهام المتخصصة:
use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{AdapterConfig, Llm, MistralRsAdapterModel, MistralRsConfig, ModelSource};
use adk_rust::Launcher;
use std::sync::Arc;
#[tokio::main]
async fn main() -> anyhow::Result<()> {
// Load base model with LoRA adapter
let config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("meta-llama/Llama-3.2-3B-Instruct"))
.adapter(AdapterConfig::lora("username/my-lora-adapter"))
.build();
println!("Loading model with LoRA adapter...");
let model = MistralRsAdapterModel::new(config).await?;
println!("Model loaded: {}", model.name());
println!("Available adapters: {:?}", model.available_adapters());
let agent = LlmAgentBuilder::new("lora_assistant")
.instruction("You are a helpful assistant with specialized knowledge.")
.model(Arc::new(model))
.build()?;
Launcher::new(Arc::new(agent)).run().await?;
Ok(())
}
تبديل المحولات السريع في وقت التشغيل:
model.swap_adapter("another-adapter").await?;
الخطوة 5: نماذج الرؤية (فهم الصور)
معالجة الصور باستخدام نماذج الرؤية واللغة:
use adk_mistralrs::{Llm, MistralRsConfig, MistralRsVisionModel, ModelSource};
#[tokio::main]
async fn main() -> anyhow::Result<()> {
let config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("microsoft/Phi-3.5-vision-instruct"))
.build();
println!("Loading vision model...");
let model = MistralRsVisionModel::new(config).await?;
println!("Model loaded: {}", model.name());
// Analyze an image
let image = image::open("photo.jpg")?;
let response = model.generate_with_image("Describe this image.", vec![image]).await?;
Ok(())
}
الخطوة 6: خدمة النماذج المتعددة
خدمة نماذج متعددة من مثيل واحد:
use adk_mistralrs::{MistralRsConfig, MistralRsMultiModel, ModelSource};
#[tokio::main]
async fn main() -> anyhow::Result<()> {
let multi = MistralRsMultiModel::new();
// Add models
let phi_config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
.build();
multi.add_model("phi", phi_config).await?;
let gemma_config = MistralRsConfig::builder()
.model_source(ModelSource::huggingface("google/gemma-2-2b-it"))
.build();
multi.add_model("gemma", gemma_config).await?;
// Set default and route requests
multi.set_default("phi").await?;
println!("Available models: {:?}", multi.model_names().await);
// Route to specific model
// multi.generate_with_model(Some("gemma"), request, false).await?;
Ok(())
}
مصادر النماذج
HuggingFace المحور (افتراضي)
ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct")
الدليل المحلي
ModelSource::local("/path/to/model")
GGUF مكممة مسبقًا
ModelSource::gguf("/path/to/model.Q4_K_M.gguf")
النماذج الموصى بها
| النموذج | الحجم | ذاكرة الوصول العشوائي المطلوبة | الأفضل لـ |
|---|---|---|---|
google/gemma-4-4b-it | 4B | 8GB | Gemma 4 — متعدد الوسائط (نص، صورة، صوت، فيديو)، Apache 2.0 |
google/gemma-4-12b-it | 12B | 24GB | Gemma 4 — استدلال متعدد الوسائط عالي الجودة |
microsoft/Phi-3.5-mini-instruct | 3.8B | 8GB | سريع، للأغراض العامة |
microsoft/Phi-3.5-vision-instruct | 4.2B | 10GB | رؤية + نص |
Qwen/Qwen3-4B | 4B | 8GB | متعدد اللغات، برمجة، استدلال |
Qwen/Qwen3.5-7B-Instruct | 7B | 16GB | أحدث Qwen مع استدلال قوي |
google/gemma-2-2b-it | 2B | 4GB | خفيف الوزن |
mistralai/Mistral-7B-Instruct-v0.3 | 7B | 16GB | جودة عالية |
تسريع الأجهزة
macOS (معالجات Apple Silicon)
adk-mistralrs = { version = "2.0.0", features = ["metal"] }
تسريع Metal تلقائي على أجهزة Mac المزودة بمعالجات M1/M2/M3.
وحدة معالجة الرسوميات NVIDIA
adk-mistralrs = { version = "2.0.0", features = ["cuda"] }
يتطلب CUDA toolkit 11.8+.
وحدة المعالجة المركزية فقط
لا توجد ميزات مطلوبة - وحدة المعالجة المركزية هي الافتراضية.
التحقق من صحة الكريت
cargo build -p adk-mistralrs
cargo build -p adk-mistralrs --features metal
استكشاف الأخطاء وإصلاحها
نفاد الذاكرة
// Enable quantization
.isq(QuantizationLevel::Q4_0)
// Enable paged attention
.paged_attention(true)
بطء التحميل الأول
- يقوم التشغيل الأول بتنزيل النموذج (~2-8 جيجابايت)
- تستخدم التشغيلات اللاحقة النموذج المخزن مؤقتًا
النموذج غير موجود
- تحقق من أن معرف النموذج HuggingFace صحيح
- تأكد من وجود اتصال بالإنترنت للتنزيل الأول
ذات صلة
- موفرو النماذج - موفرو LLM السحابيون
- Ollama - خادم نماذج محلي بديل
- LlmAgent - استخدام النماذج مع agents
السابق: ← Ollama (محلي) | التالي: Function Tools →