रियलटाइम उदाहरण
examples/ डायरेक्टरी में चार चलाने योग्य उदाहरण, वे कितना सिखाते हैं, इसके मोटे क्रम में। सभी server-side bridge का उपयोग करते हैं; सभी या तो OpenAI या Gemini पर चलते हैं। पहले संबंधित कुंजी सेट करें:
export OPENAI_API_KEY=sk-… # for OpenAI sessions
export GEMINI_API_KEY=… # for Gemini sessions (or GOOGLE_API_KEY)
realtime_tools
हेडलेस। सबसे स्पष्ट पहली बार पढ़ने के लिए। एक कंसोल प्रोब (कोई ब्राउज़र नहीं) जो IntegratedRealtimeRunner पर tool dispatch का अभ्यास करता है: single-tool, parallel-tool, और कैलकुलेटर टर्न, जिसमें session/memory/transcript एकत्रीकरण जुड़ा हुआ है। एक tool turn कैसे प्रवाहित होता है, इसकी सबसे छोटी एंड-टू-एंड तस्वीर।
cargo run --manifest-path examples/realtime_tools/Cargo.toml
runner को समझने के लिए यहाँ से शुरू करें; फिर ऑडियो के लिए वेब उदाहरणों पर जाएँ।
realtime_voice — मिया के साथ माइंडफुलनेस
प्रमुख उदाहरण। एक पूर्ण वेब वॉयस ऐप: ब्राउज़र माइक PCM16 कैप्चर करता है और agent को बिना किसी रुकावट के barge-in के साथ चलाता है; Rust सर्वर session का मालिक है। इसकी असाधारण विशेषता memory है: एक फ़ाइल-समर्थित GraphMemoryService मिया की दीर्घकालिक memory है — उसका प्रोफ़ाइल कार्ड session शुरू होने पर डाला जाता है, हर turn को graph में लॉग किया जाता है, और वह bridged remember/relate tools के माध्यम से बातचीत के दौरान टिकाऊ तथ्यों को व्यवस्थित करती है। एक लाइव "User Memory Insights" पैनल /api/memory पर उसी graph को पढ़ता और लिखता है। एक server-side get_weather tool भी दिखाता है।
| हल्का | गहरा |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/realtime_voice/Cargo.toml
# → http://localhost:3033
इसे इसके लिए पढ़ें: वेब ऑडियो कैप्चर/प्लेबैक, नॉलेज-ग्राफ मेमोरी, एजेंट सेल्फ-क्यूरेशन।
customer_service — Aria
मल्टीमॉडल शोकेस। Google के "कस्टमर सर्विस एजेंट" लाइव API डेमो का एक नया डिज़ाइन किया गया संस्करण — बैकएंड-अज्ञेयवादी, Rust में, एक थीम वाले (सिस्टम/लाइट/डार्क) तीन-कॉलम UI के साथ। यह सब कुछ जोड़ता है:
- मल्टीमॉडल — माइक PCM और कैमरा JPEG फ़्रेम स्ट्रीम करता है; Aria वह देखती है जो आप उसे दिखाते हैं (
send_video_frame)। - Tools —
process_refundऔरconnect_to_humanसर्वर-साइड चलते हैं; परिणाम वापस बोले जाते हैं। - अफेक्टिव डायलॉग — दोनों बैकएंड पर सहानुभूतिपूर्ण;
CS_AFFECTIVE=1Gemini को सही टोन-मैचिंग के लिए नेटिव-ऑडियो मॉडल पर स्विच करता है।
| हल्का | गहरा |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/customer_service/Cargo.toml
# → http://localhost:3066
# headless smoke test (verifies the refund tool runs):
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe openai
cargo run --manifest-path examples/customer_service/Cargo.toml -- probe gemini
# enable Gemini native affective dialogue:
CS_AFFECTIVE=1 cargo run --manifest-path examples/customer_service/Cargo.toml
इसके लिए पढ़ें: वीडियो इनपुट, एक ही Agent में मल्टीमॉडल + Tool + Affect को मिलाना।
live_translation
समर्पित-मॉडल उदाहरण। एक वास्तविक समय का स्पीच-टू-स्पीच अनुवादक: अंग्रेजी बोलें, कुछ सेकंड बाद स्पेनिश सुनें। वही ब्रिज, लेकिन प्रदाताओं के अनुवाद मॉडल की ओर इंगित किया गया है — OpenAI gpt-realtime-translate और Gemini gemini-3.5-live-translate-preview — जो संवादात्मक मॉडल की तुलना में एक अलग प्रोटोकॉल बोलते हैं। UI में एक लक्ष्य भाषा चुनें; ऑडियो प्रवाहित होने से पहले सर्वर प्रति-प्रदाता ऑडियो दरों पर बातचीत करता है।
| हल्का | गहरा |
|---|---|
![]() | ![]() |
cargo run --manifest-path examples/live_translation/Cargo.toml
# → http://localhost:3055
cargo run --manifest-path examples/live_translation/Cargo.toml -- probe openai
इसे इसके लिए पढ़ें: समर्पित अनुवाद मॉडल और एक केंद्रित, न्यूनतम ब्रिज का उपयोग करना।
एक सुझाया गया मार्ग
realtime_tools— runner और एक टूल टर्न देखें, कोई ऑडियो शोर नहीं।realtime_voice— वास्तविक ऑडियो और नॉलेज-ग्राफ मेमोरी जोड़ें।customer_service— दृष्टि और प्रभाव जोड़ें; पूर्ण मल्टीमॉडल एजेंट।live_translation— एक विशेष मॉडल और प्रोटोकॉल।
उदाहरण डायरेक्टरी में प्रत्येक README.md में पूर्ण env-var तालिका, मॉडल ओवरराइड्स (OPENAI_REALTIME_MODEL / GEMINI_REALTIME_MODEL), और आर्किटेक्चर नोट्स हैं।
← वापस रीयलटाइम अवलोकन





