Echtzeit-Beispiele
Vier ausführbare Beispiele im examples/
Verzeichnis, grob geordnet nach ihrem Lehrwert. Alle verwenden die
server-side bridge; alle laufen entweder mit OpenAI oder
Gemini. Legen Sie zuerst den entsprechenden Schlüssel fest:
export OPENAI_API_KEY=sk-… # for OpenAI sessions
export GEMINI_API_KEY=… # for Gemini sessions (or GOOGLE_API_KEY)
realtime_tools
Headless. Der klarste Ersteinstieg. Eine Konsolensonde (ohne Browser), die
tool dispatch auf IntegratedRealtimeRunner ausführt: single-tool,
parallel-tool und calculator turns, mit integrierter session/memory/transcript aggregation.
Das kleinste End-to-End-Bild, wie ein Tool-Turn abläuft.
cargo run --manifest-path examples/realtime_tools/Cargo.toml
Beginnen Sie hier, um den Runner zu verstehen; wechseln Sie dann zu den Web-Beispielen für Audio.
realtime_voice — Achtsamkeit mit Mia
Das Flaggschiff. Eine vollständige Web-Sprach-App: Der Browser erfasst Mikrofon-PCM16 und spielt den Agenten lückenlos mit Barge-in ab; der Rust-Server besitzt die Session. Sein herausragendes Merkmal ist Speicher: ein dateigestütztes GraphMemoryService ist Mias Langzeitgedächtnis — ihre Profilkarte wird beim Session-Start injiziert, jede Runde wird im Graphen protokolliert, und sie kuratiert dauerhafte Fakten mitten im Gespräch über die überbrückten remember/relate Tools. Ein Live-"User Memory Insights"-Panel liest und schreibt denselben Graphen über /api/memory. Zeigt auch ein serverseitiges get_weather Tool.
| Hell | Dunkel |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/realtime_voice/Cargo.toml
# → http://localhost:3033
Lesen Sie es für: Web-Audio-Erfassung/-Wiedergabe, Wissensgraphen-Speicher, Agenten-Selbstkuratierung.
customer_service — Aria
Das multimodale Vorzeigeprojekt. Eine neu gestaltete Version der Google "Customer Service Agent" Live API Demo — Backend-agnostisch, in Rust, mit einer thematischen (System/Hell/Dunkel) dreispaltigen Benutzeroberfläche. Es kombiniert alles:
- Multimodal — streamt Mikrofon-PCM und Kamera-JPEG-Frames; Aria sieht, was Sie ihr zeigen (
send_video_frame). - Tools —
process_refundundconnect_to_humanlaufen serverseitig; Ergebnisse werden zurückgesprochen. - Affektiver Dialog — empathisch auf beiden Backends;
CS_AFFECTIVE=1schaltet Gemini auf das native-audio-Modell für echte Tonanpassung um.
| Hell | Dunkel |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/customer_service/Cargo.toml
# → http://localhost:3066
# headless smoke test (verifies the refund tool runs):
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe openai
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe gemini
# enable Gemini native affective dialogue:
CS_AFFECTIVE=1 cargo run --manifest-path examples/customer_service/Cargo.toml
Lesen Sie es für: Videoeingabe, Mischen von multimodal + Tools + Affekt in einem Agent.
live_translation
Das Beispiel mit dediziertem Modell. Ein Echtzeit-Sprach-zu-Sprach-Übersetzer: Sprechen Sie Englisch, hören Sie Spanisch ein paar Sekunden später. Dieselbe Brücke, aber auf die Übersetzungsmodelle der Anbieter ausgerichtet – OpenAI gpt-realtime-translate und Gemini gemini-3.5-live-translate-preview – die ein anderes Protokoll sprechen als die Konversationsmodelle. Wählen Sie eine Zielsprache in der Benutzeroberfläche; der Server verhandelt anbieterspezifische Audioraten, bevor Audio übertragen wird.
| Hell | Dunkel |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/live_translation/Cargo.toml
# → http://localhost:3055
cargo run --manifest-path examples/live_translation/Cargo.toml -- probe openai
Verwendung der dedizierten Übersetzungsmodelle und einer fokussierten, minimalen Brücke.
Ein vorgeschlagener Pfad
realtime_tools— sehen Sie den Runner und einen Tool-Zug, kein Audiogeräusch.realtime_voice— echtes Audio und Wissensgraphen-Speicher hinzufügen.customer_service— Sehen und Affekt hinzufügen; der vollständige multimodale Agent.live_translation— ein spezialisiertes Modell und Protokoll.
Jedes README.md im Beispielverzeichnis enthält die vollständige Umgebungsvariablen-Tabelle, Modell-Überschreibungen (OPENAI_REALTIME_MODEL / GEMINI_REALTIME_MODEL) und Architekturhinweise.
← Zurück zur Echtzeit-Übersicht





