Transformer के भीतर की दुनिया, Oasis
(oasis-model.github.io)- रियल-टाइम जनरेटिव वीडियो को गेम की तरह इनपुट पर प्रतिक्रिया देनी हो तो फ्रेम जनरेशन स्पीड सबसे अहम होती है, और Oasis को 20fps इंटरैक्टिव AI वर्ल्ड के लक्ष्य के साथ जारी किया गया है
- Decart और Etched ने ऐसा ओपन-वर्ल्ड अनुभव दिखाया है जिसमें physics, rules और graphics अलग इंजन से नहीं बल्कि foundation model के आउटपुट से बनते हैं
- रिलीज़ में लाइव डेमो, कोड, लोकल पर चल सकने वाले 500M parameter model weights, और बड़े checkpoint आधारित डेमो शामिल हैं
- इसकी संरचना Transformer-आधारित spatial autoencoder और latent diffusion backbone पर बनी है, और यह यूज़र इनपुट के अनुसार फ्रेम को autoregressive तरीके से जनरेट करता है
- लंबी दूरी पर धुंधलापन, ऑब्जेक्ट की temporal consistency, domain generalization, inventory control, और लंबे context को संभालना अभी भी सीमाएँ हैं, जिनके लिए model·dataset scaling और inference सुधार की ज़रूरत है
इनपुट पर प्रतिक्रिया देने वाली AI दुनिया
- Oasis Decart और Etched द्वारा प्रस्तुत रियल-टाइम ओपन-वर्ल्ड AI मॉडल है
- यह यूज़र के keyboard input को लेकर movement, jump, item pickup, block destruction जैसे इंटरैक्टिव अनुभव बनाता है
- physics, rules और graphics तक मॉडल के आउटपुट में शामिल होते हैं, और अलग physics engine के बिना सिर्फ foundation model से अनुभव तैयार किया जाता है
- जारी किए गए resources इस प्रकार हैं
- Try demo: लाइव डेमो
- View code: कोड
- Model weights: लोकल पर चल सकने वाले 500M parameter model weights
- Decart Blog, Etched Blog: तकनीकी विवरण
- उदाहरण परिणामों में building, lighting physics, inventory management, object understanding, animal interaction, खाना खाने पर health recovery, और shovel का हाथ से तेज़ काम करना जैसी बातें शामिल हैं
- जनरेट किए जा सकने वाले वातावरण में अंधेरे outer space जैसी जगहें, night scenes, अलग-अलग object placement, inventory chest खोलना, animals और characters शामिल हैं
- text, audio और दूसरी modalities के ज़रिए अनुभव को नियंत्रित करने जैसी विस्तार दिशाएँ भी संभव हैं
Transformer संरचना और रियल-टाइम inference
- मॉडल spatial autoencoder और latent diffusion backbone से बना है
- दोनों components Transformer-आधारित हैं
- autoencoder, ViT-आधारित है और backbone, DiT-आधारित है
- GameNGen, DIAMOND जैसे action-conditioned world model के विपरीत Transformer चुनने के कारण हैं stable और predictable scaling, और Etched के Transformer ASIC Sohu पर तेज़ inference
- Sora जैसे bidirectional model से अलग, Oasis फ्रेम को autoregressive तरीके से जनरेट करता है
- इससे हर फ्रेम को यूज़र इनपुट पर conditioned बनाया जा सकता है और रियल-टाइम interaction संभव होता है
- training में token-स्तर के independent noise level पर denoise करने वाली Diffusion Forcing का उपयोग किया गया है
- लंबे समय तक आउटपुट को स्वाभाविक बनाए रखने वाली temporal stability एक मुख्य चुनौती थी
- autoregressive model में errors जमा होते जाते हैं और छोटी खामियाँ glitch frames में बदल सकती हैं
- इसे कम करने के लिए inference के समय schedule के अनुसार noise को समायोजित करने वाली dynamic noising का उपयोग किया जाता है
- शुरुआती diffusion forward pass में noise inject करके error accumulation कम किया जाता है, और बाद के pass में noise को धीरे-धीरे हटाकर पिछले फ्रेम की high-frequency details को बनाए रखा जाता है
20fps प्रदर्शन और हार्डवेयर bottleneck
- Oasis 20fps पर रियल-टाइम आउटपुट जनरेट करता है
- Sora, Mochi-1, Runway जैसे समान DiT संरचना वाले text-to-video models को कई GPU पर भी 1 सेकंड का वीडियो बनाने में 10~20 सेकंड लग सकते हैं
- रियल-टाइम interaction के लिए हर 0.04 सेकंड में नया फ्रेम बनाना पड़ता है, जो 100 गुना से भी अधिक तेज़ है
- Decart के inference stack की मदद से लाइव framerate execution संभव है
- और तेज़, बड़े पैमाने पर, तथा cost-efficient execution के लिए नए hardware की ज़रूरत है
- Oasis, Etched के Transformer ASIC Sohu के लिए optimized है
- Sohu को 4K resolution वाले 100B+ अगली पीढ़ी के models तक scale किया जा सकता है
- Oasis की end-to-end Transformer संरचना Sohu पर efficient है, और 100B+ parameter models में भी 10 गुना से अधिक users को संभाल सकती है
अभी बची हुई सीमाएँ
- लंबी दूरी के वीडियो में blur, अनिश्चित objects की temporal consistency, domain generalization, inventory का सूक्ष्म नियंत्रण, objects का सूक्ष्म नियंत्रण, और लंबे time span के लिए सीमित memory जैसी कमियाँ अभी बाकी हैं
- architecture configuration, data, और model size पर sensitivity analysis के बाद यह परिकल्पना रखी गई है कि कई समस्याएँ model और dataset scaling से हल हो सकती हैं
- बड़े models विकसित होने पर भी latency और cost का संतुलन बनाए रखने के लिए नई inference techniques की आवश्यकता होगी
1 टिप्पणियां
Hacker News की राय
अगर आप Minecraft में सपना देख रहे हों, तो शायद कुछ ऐसा ही महसूस होगा
object persistence की कमी की वजह से यह सचमुच सपने जैसा लगता है। lighting level भी दिलचस्प हैं; अगर आप किसी अंधेरी जगह को देर तक देखते रहें या “पानी के अंदर” चले जाएँ और स्क्रीन काली हो जाए, तो काली स्क्रीन के अलावा किसी दूसरी स्थिति में लौटना मुश्किल हो जाता है। मैंने एक बार खेलने पर इसमें सफलता नहीं पाई। यह काफ़ी अजीब एहसास है
मुझे समझ नहीं आता कि इस तरह से गेम को design और release कैसे किया जाएगा। आप model weights को सीधे सेट करके गेम design नहीं कर सकते
शायद कभी object persistence या long-term state जैसे गायब हिस्सों के बिना भी गेम की नकल कर पाएँगे, लेकिन inference engine चलाने की लागत, जिस game engine की यह नकल कर रहा है, उससे ज़्यादा महंगी होने की संभावना है। लंबे समय से AI में काम करने वाले व्यक्ति के तौर पर मुझे सच में जिज्ञासा है कि यह तकनीक कहाँ उपयोगी होगी
मैं सहमत हूँ कि ये tools तब बेहद उपयोगी बनेंगे जब creators इस system के ऊपर नई worlds या games “develop” कर सकें और users उन worlds से interact कर सकें। अंततः इसे game engine जैसी “API” देनी होगी। creator दुनिया बनाता है और user उससे interact करता है। अगर AI वाकई यह भूमिका निभा सके, तो 1) “यहाँ उड़ता हुआ गुलाबी हाथी जोड़ो” जैसा कहकर worlds और games बनाना कहीं आसान हो सकता है, और 2) users ऐसी worlds से interact कर सकेंगे जो हर play session के हिसाब से बदलती हैं, इसलिए सचमुच अनंत worlds संभव होंगी। क्या हम वहाँ पहुँच गए हैं? बिल्कुल नहीं। Oasis v1 पहला proof of concept है, और v2 के लिए बस थोड़ा और इंतज़ार करें ;)
लेकिन “design” के लिहाज़ से, भले ही यह बहुत GPU इस्तेमाल करे, games को जल्दी prototype करने में यह कितना उपयोगी हो सकता है, यह देखना मुश्किल नहीं है। ऐसे papers उस दिशा में सिर्फ़ stepping stones हैं
अगर AI वास्तविक renderer या engine के लिए inputs generate करे, तो visual fidelity की समस्या हल हो सकती है
कई models को मिलाएँ, हर game “world model” के टुकड़े लें और combine करें, तो यह लगभग पूरी तरह नया game बनाने जैसा हो जाएगा। object persistence या long-term state जैसे गायब हिस्सों को variables के बहुत छोटे set से जोड़ा जा सकता है। जब पहले से पूरा पिछला frame और user input weights में डाले जा रहे हैं, तो simplified game state भी साथ में न डाल पाने की कोई वजह नहीं दिखती
वे इसे “पूरी तरह AI-generated video game” कहते हैं, लेकिन webpage पर Ctrl-F करके देखा तो Minecraft 0 बार मिला। समझ नहीं आया क्यों
यह video game नहीं, बल्कि असली video game की घटिया copy है, और उसका नाम लेने या credit देने की कोशिश तक नहीं की गई
“Minecraft” नहीं कह सकते क्योंकि वह Microsoft का trademark है, लेकिन लगता है कि वे Minecraft images को training data के तौर पर इस्तेमाल करना ठीक मानते हैं। Microsoft सहित हर कोई diffusion models train करने के लिए proprietary data इस्तेमाल कर रहा है। समस्या यह है कि output साफ़ तौर पर Minecraft जैसा दिखता है, लेकिन Microsoft के सामने भी यह दिक्कत है कि safeguards के बावजूद Bing और DALL-E trademark वाली चीज़ों से साफ़ तौर पर मिलती-जुलती images generate करते हैं
पता नहीं यह मूल comment के बाद जोड़ा गया था या नहीं
अगर कोई scientific work किसी work का उपयोग करता है और credit नहीं देता, तो यह academic dishonesty है। वे किसी और dataset पर train कर सकते थे, लेकिन जो भी source इस्तेमाल किया हो, उसे cite करना चाहिए
यह सचमुच शानदार है, और ऐसे models को तेज़ी से आगे बढ़ते देखना भी अच्छा है। हालांकि मैं जानना चाहूँगा कि long-term state कैसे काम करेगी
उदाहरण के लिए base बनाकर बाद में वापस आना, पारंपरिक code से enforce होने वाले game rules, multiplayer, saved game load करना जैसी guided state कैसे संभाली जाएगी, यह स्पष्ट नहीं है। मूल रूप से external state और memory/simulation अलग चीज़ें हैं, इसलिए सिर्फ़ context window बढ़ाने या model बड़ा करने से शायद काम नहीं चलेगा। हाँ, उससे मदद ज़रूर मिल सकती है। वैसे भी, ऐसे models जल्द ही goal-oriented tasks की imagination में इस्तेमाल होते दिखेंगे। जैसे कोई agent जिसे computer पर कोई specific image खोजनी है, वह current state और desired state के बीच का path लगातार imagine करे। यह model user input लेता है, लेकिन ऐसा agent उस input तक को imagine करेगा। मेरी समझ के अनुसार कुछ robot control networks में pixels के बिना पहले से कुछ ऐसा हो रहा है
कुछ चक्कर लगाने के बाद details गायब हो जाती हैं और आप खाली समुद्र के बीच रह जाते हैं। इस technology से Minecraft तो दूर, Mario का playable version भी कभी नहीं बन पाएगा लगता है
यह video game नहीं है; यह ज़्यादा एक तेज़ Minecraft screenshot simulator जैसा है, जिसमें हर frame के बीच prompt input state और पिछला frame होते हैं
कुछ हद तक consistency जैसी चीज़ है
मूल रूप से model को Minecraft पर train किया गया है। यह बिल्कुल general-purpose नहीं है
game prompt से नहीं निकला है; संभवतः यह Minecraft gameplay के बड़े dataset और fine-tuning से निकला है। मैं ऐसा काम देखना चाहूँगा जहाँ prompt से दुनिया या game निकलें
संदर्भ के लिए, मैं Oasis team से हूँ
अगर खेलते समय user को frame buffer पर सीधे draw करने दिया जाए और उसे वापस input में डाल दिया जाए, तो काफ़ी दिलचस्प चीज़ निकल सकती है
queue बहुत लंबी थी, इसलिए मैंने छोड़ दिया। जानना चाहता हूँ कि क्या model खुद pixels generate करता है, या सिर्फ़ environment generate करके उसे “traditional” तरीके से render करता है
यह दिलचस्प क्यों है—आज के हिसाब से शायद बहुत दिलचस्प न लगे। Oasis v1 सिर्फ़ proof of concept है। लेकिन भविष्य के बारे में सोचें, सचमुच कुछ महीनों बाद आने वाले Oasis के अगले versions के बारे में, तो आप ऐसी स्थिति की कल्पना कर सकते हैं जहाँ आप जो भी pixels देखते हैं वे generate किए गए हों, यहाँ तक कि इस message को पढ़ते हुए दिख रहे pixels भी। यह इंसान और मशीन के बीच communication का नया interface है। अगर LLM chat में इसलिए दिलचस्प है क्योंकि वह इंसान और मशीन को इंसानों के परिचित तरीके, यानी बातचीत, से interact करने देता है, तो यहाँ computer दुनिया को हमारे देखने के तरीके से देख सकता है और हमें फिर उसी परिचित तरीके से दिखा सकता है। संक्षेप में, computer से “pink elephant बनाओ” कहें और कल्पना करें कि वह आपके खेले जा रहे game में तुरंत दिखने लगे
शायद Mario game पर model train कराना चाहिए, ताकि Nintendo को “अच्छे मकसद” के लिए लड़ने पर मजबूर किया जा सके