Echtzeit-Beispiele

Vier ausführbare Beispiele im examples/ Verzeichnis, grob geordnet nach ihrem Lehrwert. Alle verwenden die server-side bridge; alle laufen entweder mit OpenAI oder Gemini. Legen Sie zuerst den entsprechenden Schlüssel fest:

export OPENAI_API_KEY=sk-…        # for OpenAI sessions
export GEMINI_API_KEY=…           # for Gemini sessions (or GOOGLE_API_KEY)

realtime_tools

Headless. Der klarste Ersteinstieg. Eine Konsolensonde (ohne Browser), die tool dispatch auf IntegratedRealtimeRunner ausführt: single-tool, parallel-tool und calculator turns, mit integrierter session/memory/transcript aggregation. Das kleinste End-to-End-Bild, wie ein Tool-Turn abläuft.

cargo run --manifest-path examples/realtime_tools/Cargo.toml

Beginnen Sie hier, um den Runner zu verstehen; wechseln Sie dann zu den Web-Beispielen für Audio.


realtime_voiceAchtsamkeit mit Mia

Das Flaggschiff. Eine vollständige Web-Sprach-App: Der Browser erfasst Mikrofon-PCM16 und spielt den Agenten lückenlos mit Barge-in ab; der Rust-Server besitzt die Session. Sein herausragendes Merkmal ist Speicher: ein dateigestütztes GraphMemoryService ist Mias Langzeitgedächtnis — ihre Profilkarte wird beim Session-Start injiziert, jede Runde wird im Graphen protokolliert, und sie kuratiert dauerhafte Fakten mitten im Gespräch über die überbrückten remember/relate Tools. Ein Live-"User Memory Insights"-Panel liest und schreibt denselben Graphen über /api/memory. Zeigt auch ein serverseitiges get_weather Tool.

HellDunkel
Achtsamkeit mit Mia — helles DesignAchtsamkeit mit Mia — dunkles Design
cargo run --manifest-path examples/realtime_voice/Cargo.toml
# → http://localhost:3033

Lesen Sie es für: Web-Audio-Erfassung/-Wiedergabe, Wissensgraphen-Speicher, Agenten-Selbstkuratierung.


customer_serviceAria

Das multimodale Vorzeigeprojekt. Eine neu gestaltete Version der Google "Customer Service Agent" Live API Demo — Backend-agnostisch, in Rust, mit einer thematischen (System/Hell/Dunkel) dreispaltigen Benutzeroberfläche. Es kombiniert alles:

  • Multimodal — streamt Mikrofon-PCM und Kamera-JPEG-Frames; Aria sieht, was Sie ihr zeigen (send_video_frame).
  • Toolsprocess_refund und connect_to_human laufen serverseitig; Ergebnisse werden zurückgesprochen.
  • Affektiver Dialog — empathisch auf beiden Backends; CS_AFFECTIVE=1 schaltet Gemini auf das native-audio-Modell für echte Tonanpassung um.
HellDunkel
Kundendienst-Agent — helles DesignKundendienst-Agent — dunkles Design
cargo run --manifest-path examples/customer_service/Cargo.toml
# → http://localhost:3066

# headless smoke test (verifies the refund tool runs):
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe openai
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe gemini

# enable Gemini native affective dialogue:
CS_AFFECTIVE=1 cargo run --manifest-path examples/customer_service/Cargo.toml

Lesen Sie es für: Videoeingabe, Mischen von multimodal + Tools + Affekt in einem Agent.


live_translation

Das Beispiel mit dediziertem Modell. Ein Echtzeit-Sprach-zu-Sprach-Übersetzer: Sprechen Sie Englisch, hören Sie Spanisch ein paar Sekunden später. Dieselbe Brücke, aber auf die Übersetzungsmodelle der Anbieter ausgerichtet – OpenAI gpt-realtime-translate und Gemini gemini-3.5-live-translate-preview – die ein anderes Protokoll sprechen als die Konversationsmodelle. Wählen Sie eine Zielsprache in der Benutzeroberfläche; der Server verhandelt anbieterspezifische Audioraten, bevor Audio übertragen wird.

HellDunkel
Live-Übersetzung — helles DesignLive-Übersetzung — dunkles Design
cargo run --manifest-path examples/live_translation/Cargo.toml
# → http://localhost:3055
cargo run --manifest-path examples/live_translation/Cargo.toml -- probe openai

Verwendung der dedizierten Übersetzungsmodelle und einer fokussierten, minimalen Brücke.


Ein vorgeschlagener Pfad

  1. realtime_tools — sehen Sie den Runner und einen Tool-Zug, kein Audiogeräusch.
  2. realtime_voice — echtes Audio und Wissensgraphen-Speicher hinzufügen.
  3. customer_service — Sehen und Affekt hinzufügen; der vollständige multimodale Agent.
  4. live_translation — ein spezialisiertes Modell und Protokoll.

Jedes README.md im Beispielverzeichnis enthält die vollständige Umgebungsvariablen-Tabelle, Modell-Überschreibungen (OPENAI_REALTIME_MODEL / GEMINI_REALTIME_MODEL) und Architekturhinweise.

← Zurück zur Echtzeit-Übersicht