लोकल एजेंट (Hermes/OpenClaw) से बात करने के लिए Telegram टैब पूरे दिन खुला रखना मुझे पसंद नहीं था, इसलिए मैंने उसकी जगह लेने के लिए एक अवतार बनाया। यह मॉनिटर पर हमेशा रहने वाली video-call जैसी दो विंडो (अवतार + चैट) के रूप में है, जहाँ एजेंट के जवाबों को पढ़वाने के बजाय उनसे “अभिनय” करवाया जाता है।
-
अवतार runtime GPU इस्तेमाल नहीं करता। real-time inference के बजाय, पहले से render किए गए लगभग 30 क्लिप LLM आउटपुट के emotion tags के आधार पर चुनकर चलाए जाते हैं।
[working]हो तो वह चश्मा पहनकर नोट्स बनाता है,[confirm]टैग पर approve/cancel दिखता है ताकि irreversible काम से पहले पूछा जा सके, और code/logs को पढ़कर सुनाने के बजाय cards के रूप में render किया जाता है। GPU पूरी तरह model के लिए रहता है। -
यह एजेंट को replace नहीं करता, बल्कि connector की तरह जुड़ता है। gateway उस local WebSocket पर dial-out करता है जिसे app ने खोला है, इसलिए एजेंट के नज़रिए से बस एक नया channel जुड़ जाता है। एजेंट का slash command menu भी वैसे ही लेकर दिखाया जाता है।
-
दो-तरफ़ा voice: Edge TTS (local engine से बदला जा सकता है) + Silero VAD·faster-whisper।
-
open core (MIT). एक free starter avatar साथ में आता है, इसलिए clone करते ही यह चल जाता है। वह अवतार भी सिर्फ free local tools (Animagine XL → HunyuanVideo 1.5 i2v) से बनाया गया है, इसलिए यह documentation में लिखी production method सच में काम करती है, इसका उदाहरण भी है।
बनाते समय पता चला: video diffusion models से prompt के जरिए सूक्ष्म facial expressions बनवाना उम्मीद से मुश्किल है। Wan 2.2 5B मुँह खोलकर बड़ी हँसी तो कर सकता है, लेकिन “चिंता” या “गुस्सा” जैसे भौंहों से दिखने वाले emotions में बस expressionless निकलता था; HunyuanVideo 1.5 (8.3B step-distilled) पर बदलने के बाद उसी 12GB card पर यह तेज़ भी था और expressions भी ठीक से आए।
फिलहाल सिर्फ Windows build है, और real-time lip-sync नहीं है (pre-render approach का trade-off).
अभी कोई टिप्पणी नहीं है.