2 पॉइंट द्वारा GN⁺ 2024-05-14 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Pipecat real-time voice और multimodal conversational agents बनाने के लिए एक open source Python framework है, जो एक single voice agent से लेकर ऐसे systems तक support करता है जहां कई specialized agents handoff, parallel execution और shared bus के जरिए orchestrate होते हैं
  • इसका core design speech recognition, text-to-speech conversion, conversation processing, AI services और transport layer को composable pipelines में बांधता है, ताकि developers agent-specific logic पर focus कर सकें
  • इससे बनाए जा सकने वाले targets में Voice Assistants, multi-agent systems, AI companions, voice/video/image आधारित multimodal interfaces, interactive storytelling, customer intake/support bots और structured conversation systems तक शामिल हैं
  • Official client SDKs JavaScript, React, React Native, Swift, Kotlin, C++, ESP32 को support करते हैं, और server-side services STT, LLM, TTS, Speech-to-Speech, WebRTC/WebSocket transport, video, memory, vision/image, audio processing और analytics tools तक expand होती हैं
  • Quick start pipecat init quickstart या pipecat init से किया जा सकता है; default installation को lightweight रखा गया है और third-party AI services support के लिए ज़रूरी extras जोड़ने के तरीके से configure किया जाता है

Pipecat की भूमिका

  • Pipecat real-time voice और multimodal conversational agents बनाने के लिए एक open source Python framework है
  • यह single voice agent के साथ-साथ ऐसे multi-agent systems भी बना सकता है जहां specialized agents आपस में handoff, parallel fan-out, sidecar execution और shared bus आधारित orchestration करते हैं
  • इसे audio, video, AI services, transport layer और conversation pipelines को साथ orchestrate करने के लिए design किया गया है, ताकि agent के unique behavior को implement करने पर focus किया जा सके
  • जल्दी शुरू करने के लिए pipecat init quickstart run करें या quickstart guide follow करें

आप क्या बना सकते हैं

  • Voice Assistants: AI के साथ naturally streaming conversations करने वाले voice assistants
  • Multi-Agent Systems: ऐसी architecture जहां specialized agents handoff करते हैं, parallel में fan-out होते हैं या shared bus पर sidecar के रूप में काम करते हैं
  • AI Companions: coaches, meeting assistants, characters
  • Multimodal Interfaces: voice, video, images आदि handle करने वाले interfaces
  • Interactive Storytelling: generated media आधारित creative tools
  • Business Agents: customer intake, support bots, guided flows
  • Complex Dialog Systems: structured conversations के जरिए logic design करने वाले systems

Design features

  • Voice-first architecture के साथ speech recognition, text-to-speech conversion और conversation processing को integrate करता है
  • अलग-अलग AI services और tools connect करने के लिए pluggable architecture प्रदान करता है
  • modular components से complex behavior बनाने वाली composable pipelines को support करता है
  • हर pipeline को agent की तरह treat करता है, और उन्हें handoff, parallel fan-out, sidecar workers व distributed deployment के रूप में combine किया जा सकता है
  • WebSockets या WebRTC जैसे transport layers के जरिए ultra-low-latency real-time interactions को target करता है

Ecosystem और tools

  • Official client SDKs कई platforms से Pipecat से connect करने के लिए उपलब्ध हैं
  • Pipecat Flows Pipecat के अंदर state management सहित predefined या dynamic conversation paths configure करने देता है
    • Behavior examples flows examples में देखे जा सकते हैं
  • Voice UI Kit voice AI applications जल्दी बनाने के लिए components, hooks और templates का collection है
  • Pipecat CLI pipecat-ai के साथ आता है, और uv tool install "pipecat-ai[cli]" से install किया जाता है
    • pipecat init नया project शुरू करता है और Claude Code या Codex जैसे AI coding assistants को project बनाने में सक्षम करने के लिए setup करता है
    • runnable bot को 1 मिनट के भीतर scaffold किया जा सकता है, और बाद में CLI से agents को monitor कर production में deploy किया जा सकता है
  • Whisker Pipecat pipelines और processors के लिए real-time debugger है
  • Tail Pipecat के लिए terminal dashboard है
  • Pipecat Skills Claude Code के साथ project scaffolding, Pipecat Cloud deployment आदि support करता है
    • Installation command: claude plugin marketplace add pipecat-ai/skills

Supported services का दायरा

  • Speech-to-Text AssemblyAI, AWS, Azure, Deepgram, Google, Groq Whisper, Mistral, NVIDIA, OpenAI Whisper, Whisper, xAI आदि कई services को support करता है
  • LLM में Anthropic, AWS, Azure, Cerebras, DeepSeek, Gemini, Grok, Groq, Mistral, NVIDIA NIM, Ollama, OpenAI, OpenAI Responses, OpenRouter, Perplexity, Qwen, Together AI आदि शामिल हैं
  • Text-to-Speech AWS, Azure, Cartesia, Deepgram, ElevenLabs, Google, Groq, Hume, Kokoro, Mistral, NVIDIA, OpenAI, Piper, Resemble, Rime, Together, XTTS आदि से connect होता है
  • Speech-to-Speech AWS Nova Sonic, Gemini Multimodal Live, Grok Voice Agent, OpenAI Realtime, Ultravox को support करता है
  • Transport layer में Daily WebRTC, FastAPI Websocket, LiveKit WebRTC, SmallWebRTCTransport, Vonage WebRTC, WebSocket Server, WhatsApp, Local शामिल हैं
  • इसके अलावा Twilio·Telnyx·Vonage जैसे serializers, HeyGen·Tavus·Simli जैसे video, mem0 memory, fal·Google Imagen·Moondream आधारित vision/image, Silero VAD·Krisp Viva·RNNoise जैसे audio processing, OpenTelemetry·Sentry analytics tools को support करता है
  • पूरी list full services documentation में देखी जा सकती है

Installation और शुरुआत

  • local machine पर Pipecat run करने के बाद, तैयार होने पर agent process को cloud में move किया जा सकता है
  • शुरू करने से पहले uv install करना ज़रूरी है
curl -LsSf https://astral.sh/uv/install.sh | sh
  • CLI आधारित quick start में Pipecat CLI install करने के बाद नया phone या web/mobile bot interactively scaffold किया जाता है
uv tool install "pipecat-ai[cli]"
pipecat init
  • Manual installation में नए project में uv init और uv add pipecat-ai का इस्तेमाल करें, या existing project में uv add pipecat-ai जोड़ें
uv init my-pipecat-app
cd my-pipecat-app
uv add pipecat-ai
uv add pipecat-ai
  • Environment file cp env.example .env से set करें
  • Default package में केवल core framework शामिल है; अगर third-party AI services चाहिए तो extras जोड़ें
uv add "pipecat-ai[option,...]"
  • pip users pip install pipecat-ai और pip install "pipecat-ai[option,...]" से install कर सकते हैं

Examples और development

  • Focused examples छोटे agent examples हैं जो किसी specific service या concept में से 1–2 चीज़ें दिखाते हैं
  • Example apps complete applications हैं जिन्हें development starting point के रूप में इस्तेमाल किया जा सकता है
  • Pipecat development के लिए minimum Python 3.11 चाहिए, और recommended version Python 3.12 या उससे ऊपर है
  • Repository development environment uv sync --group dev --all-extras --no-extra gstreamer --no-extra local से set करें
    • local, gstreamer जैसे कुछ extras को system dependencies की ज़रूरत हो सकती है
  • Tests repository root से uv run pytest द्वारा run करें, और specific test uv run pytest tests/test_name.py से run करें

Contribution और help

  • Bugs को GitHub issue के रूप में खोलें, और feature ideas Discord discussion से शुरू करें
  • Code contributions के लिए CONTRIBUTING.md guide follow करें, और documentation improvements Docs PR के रूप में स्वीकार किए जा सकते हैं
  • Help पाने के रास्ते Discord, docs, X हैं

1 टिप्पणियां

 
GN⁺ 2024-05-14
Hacker News की टिप्पणियाँ
  • open source implementation देख कर अच्छा लगा, और https://www.retellai.com/, https://fixie.ai/ जैसे startup इस क्षेत्र में काफी आते दिख रहे हैं
    आखिरकार हमेशा voice-to-voice model की ज़रूरत पड़ती है, लेकिन अभी का approach आम तौर पर speech→text→text→speech जैसा दिखता है, जहाँ कई agents में 1 सुनने और 1 बोलने का काम संभालता है
    हाल ही में घोषित gpt-4o इसके साथ कैसे फिट होगा, यह देखने की उत्सुकता है

    • सूची में https://vapi.ai को भी जोड़ना चाहिए। इसके tools काफ़ी अच्छे हैं
      मैं इस क्षेत्र की अलग-अलग layers और players को लगातार track करने की कोशिश कर रहा हूँ
    • fixie.ai में वे SLM, यानी speech language model, पर काम कर रहे हैं, और जल्द ही ऐसा कुछ जारी करने वाले हैं जिसे लोग खुद आज़मा सकें
    • सोच रहा हूँ कि voice-to-voice model कैसे काम करते हैं। क्या वे बोलचाल की बारीकियाँ पकड़ने के लिए बहुत ज़्यादा tokens इस्तेमाल करते हैं?
  • शानदार है, लेकिन open source पक्ष को भी demo में दिखे जैसे audio-to-audio model की सच में ज़रूरत है। जानना चाहूँगा कि किसी को कुछ ऐसा पता है या नहीं
    संपादन: किसी ने एक ढूँढ लिया: https://news.ycombinator.com/item?id=40346992

    • Pipecat पर अभी जो ज़्यादातर examples बन रहे हैं, वे voice-to-voice पर फ़ोकस कर रहे हैं। examples बताते हैं कि इसे कैसे implement किया जाए, और hosted storytelling example को तुरंत आज़माया भी जा सकता है: https://storytelling-chatbot.fly.dev/
      बेहतर होगा कि README के examples को update किया जाए ताकि यह बात और साफ़ दिखे
    • audio-to-audio model निश्चित रूप से अगला कदम हैं, और कुल मिलाकर दिशा शायद उसी तरफ़ जाएगी
      real-time voice AI के संदर्भ में, अगर latency लगभग 800ms से कम हो जाए तो ज़्यादातर लोगों और use cases के लिए प्रतिक्रिया प्राकृतिक लगने लगती है
      GPT-4o announcement page कहता है कि audio prompt से first token तक औसतन लगभग 320ms लगता है, जो साफ़ तौर पर अगला स्तर है, इसलिए यह बहुत रोचक है। अभी GPT-4 Turbo वाले किसी भी pipeline से 800ms तक पहुँचना मुश्किल है, इसलिए इसका महत्व बड़ा है
      फिलहाल सबसे तेज़ transcription, inference और speech synthesis models को pipeline में जोड़ें तो first token तक लगभग 500ms संभव है। उदाहरण के लिए Deepgram transcription, Groq Llama-3, और Deepgram Aura voice का संयोजन
  • Siri अक्टूबर 2011 में आई, Amazon Alexa नवंबर 2014 में, और Google Assistant voice speaker मई 2016 में आया
    मेरी नज़र में Siri अब भी ऐसी बुरी हालत में है कि कोई उसे इस्तेमाल नहीं करना चाहेगा, और Alexa को मैंने सीधे इस्तेमाल नहीं किया इसलिए उस पर कहना मुश्किल है, लेकिन Google Home speaker और Android फोन पर मुझे कई सालों से कोई बड़ा सुधार नहीं दिखा। उल्टा यह और खराब हुआ है, जैसे पहले की तरह AnyList[0] में सीधे items जोड़ने के बजाय अब सिर्फ Google Keep ही काम करता है
    बहुत पहले तक संभव हो जाना चाहिए था, ऐसे बहुत सरल उदाहरण भी यह अब तक नहीं समझ पाता, जैसे “जो अभी कहा उसे ज़रा ज़ोर से दोहराओ” या “रसोई और dining room की लाइट बंद कर दो” जैसी two-step requests
    ड्राइव करते समय, बिस्तर पर लेटे हुए, खाना बनाते समय, या किसी और काम में व्यस्त होने पर voice assistant काफ़ी उपयोगी होते हैं, फिर भी शुरुआती launch के बाद से वे लगभग ठहरे हुए लगते हैं। शायद किसी को इसका कमाई वाला मॉडल नहीं मिला
    consumers के लिए बेहतर voice assistant पाने के लिए क्या चाहिए होगा? Willow[1] भी शायद बहुत आगे नहीं बढ़ पाया
    [0] https://help.anylist.com/articles/google-assistant-overview/
    [1] https://heywillow.io/
    वैसे, लगता है मैं इन दिनों दिमाग़ में चल रही बातें उंडेलते-उंडेलते thread को hijack कर गया। Pipecat सच में बहुत बढ़िया लग रहा है और उम्मीद है यह सफल हो; अच्छा होगा अगर वीकेंड में इसे आज़माने का समय मिल जाए

    • मैं मुख्य रूप से Google Home इस्तेमाल करता हूँ, लेकिन मेरे पास Echo Frames भी हैं, इसलिए Alexa भी काफ़ी नियमित रूप से इस्तेमाल करता हूँ। मेरा मुख्य use case home automation है, और इस scenario में Alexa, Google Home से कहीं ज़्यादा responsive है
      इस बात से सहमत हूँ कि Google Home कई मायनों में खराब हुआ है। AnyList का अच्छा-खासा उपयोगकर्ता होने के नाते वह बदलाव खास तौर पर निराशाजनक था
    • कुछ कामों में Siri भी ठीक है। जैसे “x को text भेजो”, “जब मैं घर पहुँचूँ तो मुझे x करने की याद दिलाना” जैसी चीज़ें
      यह बिना internet connection के भी काफ़ी अच्छा काम करता है। बस dictation इसका अपवाद है, वह internet होने पर काफ़ी बेहतर होता है
    • voice assistants के लिए एक qualitative leap ज़रूरी है, और महसूस होता है कि पिछले 18 महीनों से पहले तक वह संभव नहीं था। इसलिए यह कहना सही है कि product खुद ठहरा हुआ था
      लेकिन Amazon के नज़रिए से देखें तो यह साफ़ नहीं है कि पिछले 1 साल में किस बिंदु की technology capability पर उन्होंने रेखा खींचकर उसी आधार पर product iteration शुरू किया होगा
    • मैं Siri और Alexa दोनों का उपयोग करता हूँ, लेकिन सीमित features के उपयोग के हिसाब से Alexa ज़्यादा इस्तेमाल करने के बावजूद मुझे Alexa, Siri से बदतर लगती है
      फिर भी Alexa कम से कम “X चालू करो और Y बंद करो”, “X को Y seconds के लिए चालू करो” जैसे दो काम एक साथ संभाल सकती है
      समय के साथ यह और खराब हुई है, और मैंने एक पोस्ट पढ़कर कि माइक्रोफ़ोन पर धूल जमने से voice capture खराब हो सकता है, dust remover भी इस्तेमाल किया, लेकिन इससे समस्या हल नहीं हुई
      app में Alexa ने जो आवाज़ वास्तव में capture की, उसे सुनने पर Echo और Echo Dot 4th gen दोनों की microphone quality सच में बहुत खराब लगी। पिछले महीने मैंने low-quality audio sources पर Whisper का काफ़ी परीक्षण किया, और मुझे लगता है कि ऐसे models मेरी आवाज़ को Amazon के इस्तेमाल वाले सिस्टम से कहीं बेहतर समझेंगे
    • मैं Alexa, यानी Amazon Echo Show, इस्तेमाल करता हूँ और इसका उपयोग news briefing, weather check, music playback, timer set करने जैसी चीज़ों के लिए करता हूँ
      Alexa बुरी हालत में है और लगातार और मूर्ख होती जा रही है। यह settings को पूरी तरह नज़रअंदाज़ कर देती है, यहाँ तक कि बंद की हुई settings को फिर से चालू कर देती है
      यह अक्सर सवाल का जवाब देने के बजाय पूछती है कि क्या मैं कोई नया feature आज़माना चाहूँगा, और Flash Briefing सूची से जिन news channels को मैंने साफ़ तौर पर हटाया था, उन्हें मनमाने ढंग से फिर जोड़ देती है
      यह इतनी खराब कैसे बनी रहती है, समझ से बाहर है
  • https://feycher.com भी अभी बनाया है, यह मिलती-जुलती चीज़ है लेकिन real-time lip sync भी support करता है। रुचि हो तो बात कर सकते हैं

  • bolna नाम का एक open source voice orchestration भी बनाया जा रहा है: https://github.com/bolna-ai/bolna

  • OpenAI के voice mode में इस्तेमाल होने वाले LiveKit Agents भी open source हैं:
    https://github.com/livekit/agents

  • voice activity detection (VAD) का पूरा क्षेत्र बहुत दिलचस्प है, और खासकर जब कई वक्ता हों तब यह कैसे काम करता है, इसके बारे में और सीखना चाहता हूँ

  • इसे इस्तेमाल करके फोन कॉल का real-time translation करना हो तो शुरुआत कैसे की जाए?

    • Daily अब outbound और inbound, दोनों को support करता है: https://docs.daily.co/guides/products/dial-in-dial-out#main
      यानी बॉट को कॉल से जोड़ने के बाद उसे किसी फोन नंबर पर कॉल करने के लिए कहा जा सकता है, और यह वास्तव में काम करता है
    • यह जानने की उत्सुकता है कि फोन कॉल का real-time translation क्यों करना चाहेंगे। और Whisper भी है
  • अभी-अभी घोषित हुए GPT-4o के real-time voice का इन प्रोजेक्ट्स पर क्या असर पड़ेगा, यह जानने की उत्सुकता है
    real-time multilingual translation conversation demo वाकई चौंकाने वाला था

    • Pipecat में अब एक translation demo है जो GPT-4 Turbo का इस्तेमाल करता है, जो अब लगभग पुराने और जर्जर मॉडल जैसा लगने लगा है :-) https://github.com/pipecat-ai/pipecat/tree/main/examples/tra...
      जैसे ही GPT-4o audio input API में उपलब्ध होगा, Pipecat में 4o support जोड़ने की योजना है। दो-तरफ़ा real-time audio के लिए शायद नया WebSocket या WebRTC endpoint चाहिए होगा
    • यही जिज्ञासा मुझे भी है
      बड़े language model, speech synthesis, और speech recognition models को low latency में जोड़ने वाला pipeline बनाना ठीक है, लेकिन GPT-4o जैसे native multimodal model की तुलना में यह साफ़ तौर पर कमज़ोर लगता है
      भविष्य voice-native models का है, जो आवाज़ और बोलने के अंदाज़ की बारीकियों को समझ सकें, और वह भविष्य इतना दूर भी नहीं है