Integración de mistral.rs

Ejecuta LLMs localmente con inferencia nativa de Rust - sin servidores externos, sin claves API.


¿Qué es mistral.rs?

mistral.rs es un motor de inferencia de Rust de alto rendimiento que ejecuta LLMs directamente en tu hardware. ADK-Rust lo integra a través del crate adk-mistralrs, fijado a v0.8.0 con soporte para Gemma 4.

Puntos clave:

  • 🦀 Rust nativo - Sin Python, sin servidores externos
  • 🔒 Completamente offline - No requiere claves API ni internet
  • Aceleración por hardware - CUDA, Metal (3.1 bfloat16), optimizaciones de CPU
  • 📦 Cuantización - ISQ, MXFP4, GGUF, UQFF para ejecutar modelos grandes en hardware limitado
  • 🔧 Adaptadores LoRA - Soporte para modelos ajustados con intercambio en caliente
  • 👁️ Multimodal - Comprensión de visión, audio y video (Gemma 4, Qwen 3 VL)
  • 🎤 Voz - Reconocimiento de voz en tiempo real Voxtral
  • 🎯 Multimodelo - Sirve múltiples modelos desde una única instancia

Paso 1: Añadir Dependencias

adk-mistralrs se publica en crates.io como miembro del espacio de trabajo. Añádelo como una dependencia estándar:

[package]
name = "my-local-agent"
version = "0.1.0"
edition = "2024"

[dependencies]
adk-mistralrs = "2.0.0"
adk-agent = "2.0.0"
adk-rust = "2.0.0"
tokio = { version = "1", features = ["full"] }
anyhow = "1.0"

Para la aceleración por hardware, añade las banderas de características:

# macOS with Apple Silicon
adk-mistralrs = { version = "2.0.0", features = ["metal"] }

# NVIDIA GPU (requires CUDA toolkit)
adk-mistralrs = { version = "2.0.0", features = ["cuda"] }

Paso 2: Ejemplo Básico

Cargar un modelo de HuggingFace y ejecutarlo localmente:

use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{Llm, MistralRsConfig, MistralRsModel, ModelSource};
use adk_rust::Launcher;
use std::sync::Arc;

#[tokio::main]
async fn main() -> anyhow::Result<()> {
    // Load model from HuggingFace (downloads on first run)
    let config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
        .build();

    println!("Loading model (this may take a while on first run)...");
    let model = MistralRsModel::new(config).await?;
    println!("Model loaded: {}", model.name());

    // Create agent
    let agent = LlmAgentBuilder::new("local_assistant")
        .description("Local AI assistant powered by mistral.rs")
        .instruction("You are a helpful assistant running locally. Be concise.")
        .model(Arc::new(model))
        .build()?;

    // Run interactive chat
    Launcher::new(Arc::new(agent)).run().await?;

    Ok(())
}

Qué sucede:

  1. La primera ejecución descarga el modelo de HuggingFace (~2-8GB dependiendo del modelo)
  2. El modelo se guarda en caché localmente en ~/.cache/huggingface/
  3. Las ejecuciones posteriores cargan desde la caché al instante

Paso 3: Reducir la memoria con cuantificación

Los modelos grandes necesitan mucha RAM. Usa ISQ (Cuantificación In-Situ) para reducir la memoria:

use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{Llm, MistralRsConfig, MistralRsModel, ModelSource, QuantizationLevel};
use adk_rust::Launcher;
use std::sync::Arc;

#[tokio::main]
async fn main() -> anyhow::Result<()> {
    // Load model with 4-bit quantization for reduced memory
    let config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
        .isq(QuantizationLevel::Q4_0) // 4-bit quantization
        .paged_attention(true) // Memory-efficient attention
        .build();

    println!("Loading quantized model...");
    let model = MistralRsModel::new(config).await?;
    println!("Model loaded: {}", model.name());

    let agent = LlmAgentBuilder::new("quantized_assistant")
        .instruction("You are a helpful assistant. Be concise.")
        .model(Arc::new(model))
        .build()?;

    Launcher::new(Arc::new(agent)).run().await?;

    Ok(())
}

Niveles de cuantificación:

NivelReducción de MemoriaCalidadMejor Para
Q4_0~75%BuenaRAM limitada (8GB)
Q4_1~70%MejorEquilibrado
Q8_0~50%AltaEnfocado en la calidad
Q8_1~50%Más altaMejor calidad

Paso 4: Adaptadores LoRA (Modelos ajustados)

Cargar modelos con adaptadores LoRA para tareas especializadas:

use adk_agent::LlmAgentBuilder;
use adk_mistralrs::{AdapterConfig, Llm, MistralRsAdapterModel, MistralRsConfig, ModelSource};
use adk_rust::Launcher;
use std::sync::Arc;

#[tokio::main]
async fn main() -> anyhow::Result<()> {
    // Load base model with LoRA adapter
    let config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("meta-llama/Llama-3.2-3B-Instruct"))
        .adapter(AdapterConfig::lora("username/my-lora-adapter"))
        .build();

    println!("Loading model with LoRA adapter...");
    let model = MistralRsAdapterModel::new(config).await?;
    println!("Model loaded: {}", model.name());
    println!("Available adapters: {:?}", model.available_adapters());

    let agent = LlmAgentBuilder::new("lora_assistant")
        .instruction("You are a helpful assistant with specialized knowledge.")
        .model(Arc::new(model))
        .build()?;

    Launcher::new(Arc::new(agent)).run().await?;

    Ok(())
}

Intercambiar adaptadores en caliente en tiempo de ejecución:

model.swap_adapter("another-adapter").await?;

Paso 5: Modelos de Visión (Comprensión de Imágenes)

Procesar imágenes con modelos de visión-lenguaje:

use adk_mistralrs::{Llm, MistralRsConfig, MistralRsVisionModel, ModelSource};

#[tokio::main]
async fn main() -> anyhow::Result<()> {
    let config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("microsoft/Phi-3.5-vision-instruct"))
        .build();

    println!("Loading vision model...");
    let model = MistralRsVisionModel::new(config).await?;
    println!("Model loaded: {}", model.name());

    // Analyze an image
    let image = image::open("photo.jpg")?;
    let response = model.generate_with_image("Describe this image.", vec![image]).await?;

    Ok(())
}

Paso 6: Servicio de Múltiples Modelos

Servir múltiples modelos desde una única instancia:

use adk_mistralrs::{MistralRsConfig, MistralRsMultiModel, ModelSource};

#[tokio::main]
async fn main() -> anyhow::Result<()> {
    let multi = MistralRsMultiModel::new();

    // Add models
    let phi_config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct"))
        .build();
    multi.add_model("phi", phi_config).await?;

    let gemma_config = MistralRsConfig::builder()
        .model_source(ModelSource::huggingface("google/gemma-2-2b-it"))
        .build();
    multi.add_model("gemma", gemma_config).await?;

    // Set default and route requests
    multi.set_default("phi").await?;
    println!("Available models: {:?}", multi.model_names().await);

    // Route to specific model
    // multi.generate_with_model(Some("gemma"), request, false).await?;

    Ok(())
}

Fuentes de Modelos

HuggingFace Hub (Predeterminado)

ModelSource::huggingface("microsoft/Phi-3.5-mini-instruct")

Directorio Local

ModelSource::local("/path/to/model")

GGUF Pre-Cuantificado

ModelSource::gguf("/path/to/model.Q4_K_M.gguf")

ModeloTamañoRAM RequeridaMejor para
google/gemma-4-4b-it4B8GBGemma 4 — multimodal (texto, imagen, audio, video), Apache 2.0
google/gemma-4-12b-it12B24GBGemma 4 — razonamiento multimodal de alta calidad
microsoft/Phi-3.5-mini-instruct3.8B8GBRápido, de propósito general
microsoft/Phi-3.5-vision-instruct4.2B10GBVisión + texto
Qwen/Qwen3-4B4B8GBMultilingüe, codificación, razonamiento
Qwen/Qwen3.5-7B-Instruct7B16GBÚltimo Qwen con razonamiento potente
google/gemma-2-2b-it2B4GBLigero
mistralai/Mistral-7B-Instruct-v0.37B16GBAlta calidad

Aceleración de Hardware

macOS (Apple Silicon)

adk-mistralrs = { version = "2.0.0", features = ["metal"] }

La aceleración Metal es automática en Macs con M1/M2/M3.

NVIDIA GPU

adk-mistralrs = { version = "2.0.0", features = ["cuda"] }

Requiere el toolkit CUDA 11.8+.

Solo CPU

Validar el Crate

cargo build -p adk-mistralrs
cargo build -p adk-mistralrs --features metal

Solución de Problemas

Sin Memoria

// Enable quantization
.isq(QuantizationLevel::Q4_0)
// Enable paged attention
.paged_attention(true)

Carga Inicial Lenta

  • La primera ejecución descarga el modelo (~2-8GB)
  • Las ejecuciones subsiguientes usan el modelo en caché

Modelo No Encontrado

  • Comprobar que el ID del modelo de HuggingFace es correcto
  • Asegurarse de tener conexión a internet para la primera descarga


Anterior: ← Ollama (Local) | Siguiente: Function Tools →