1 पॉइंट द्वारा GN⁺ 2024-11-03 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • रियल-टाइम जनरेटिव वीडियो को गेम की तरह इनपुट पर प्रतिक्रिया देनी हो तो फ्रेम जनरेशन स्पीड सबसे अहम होती है, और Oasis को 20fps इंटरैक्टिव AI वर्ल्ड के लक्ष्य के साथ जारी किया गया है
  • Decart और Etched ने ऐसा ओपन-वर्ल्ड अनुभव दिखाया है जिसमें physics, rules और graphics अलग इंजन से नहीं बल्कि foundation model के आउटपुट से बनते हैं
  • रिलीज़ में लाइव डेमो, कोड, लोकल पर चल सकने वाले 500M parameter model weights, और बड़े checkpoint आधारित डेमो शामिल हैं
  • इसकी संरचना Transformer-आधारित spatial autoencoder और latent diffusion backbone पर बनी है, और यह यूज़र इनपुट के अनुसार फ्रेम को autoregressive तरीके से जनरेट करता है
  • लंबी दूरी पर धुंधलापन, ऑब्जेक्ट की temporal consistency, domain generalization, inventory control, और लंबे context को संभालना अभी भी सीमाएँ हैं, जिनके लिए model·dataset scaling और inference सुधार की ज़रूरत है

इनपुट पर प्रतिक्रिया देने वाली AI दुनिया

  • Oasis Decart और Etched द्वारा प्रस्तुत रियल-टाइम ओपन-वर्ल्ड AI मॉडल है
  • यह यूज़र के keyboard input को लेकर movement, jump, item pickup, block destruction जैसे इंटरैक्टिव अनुभव बनाता है
  • physics, rules और graphics तक मॉडल के आउटपुट में शामिल होते हैं, और अलग physics engine के बिना सिर्फ foundation model से अनुभव तैयार किया जाता है
  • जारी किए गए resources इस प्रकार हैं
  • उदाहरण परिणामों में building, lighting physics, inventory management, object understanding, animal interaction, खाना खाने पर health recovery, और shovel का हाथ से तेज़ काम करना जैसी बातें शामिल हैं
  • जनरेट किए जा सकने वाले वातावरण में अंधेरे outer space जैसी जगहें, night scenes, अलग-अलग object placement, inventory chest खोलना, animals और characters शामिल हैं
  • text, audio और दूसरी modalities के ज़रिए अनुभव को नियंत्रित करने जैसी विस्तार दिशाएँ भी संभव हैं

Transformer संरचना और रियल-टाइम inference

  • मॉडल spatial autoencoder और latent diffusion backbone से बना है
    • दोनों components Transformer-आधारित हैं
    • autoencoder, ViT-आधारित है और backbone, DiT-आधारित है
    • GameNGen, DIAMOND जैसे action-conditioned world model के विपरीत Transformer चुनने के कारण हैं stable और predictable scaling, और Etched के Transformer ASIC Sohu पर तेज़ inference
  • Sora जैसे bidirectional model से अलग, Oasis फ्रेम को autoregressive तरीके से जनरेट करता है
    • इससे हर फ्रेम को यूज़र इनपुट पर conditioned बनाया जा सकता है और रियल-टाइम interaction संभव होता है
    • training में token-स्तर के independent noise level पर denoise करने वाली Diffusion Forcing का उपयोग किया गया है
  • लंबे समय तक आउटपुट को स्वाभाविक बनाए रखने वाली temporal stability एक मुख्य चुनौती थी
    • autoregressive model में errors जमा होते जाते हैं और छोटी खामियाँ glitch frames में बदल सकती हैं
    • इसे कम करने के लिए inference के समय schedule के अनुसार noise को समायोजित करने वाली dynamic noising का उपयोग किया जाता है
    • शुरुआती diffusion forward pass में noise inject करके error accumulation कम किया जाता है, और बाद के pass में noise को धीरे-धीरे हटाकर पिछले फ्रेम की high-frequency details को बनाए रखा जाता है

20fps प्रदर्शन और हार्डवेयर bottleneck

  • Oasis 20fps पर रियल-टाइम आउटपुट जनरेट करता है
    • Sora, Mochi-1, Runway जैसे समान DiT संरचना वाले text-to-video models को कई GPU पर भी 1 सेकंड का वीडियो बनाने में 10~20 सेकंड लग सकते हैं
    • रियल-टाइम interaction के लिए हर 0.04 सेकंड में नया फ्रेम बनाना पड़ता है, जो 100 गुना से भी अधिक तेज़ है
    • Decart के inference stack की मदद से लाइव framerate execution संभव है
  • और तेज़, बड़े पैमाने पर, तथा cost-efficient execution के लिए नए hardware की ज़रूरत है
    • Oasis, Etched के Transformer ASIC Sohu के लिए optimized है
    • Sohu को 4K resolution वाले 100B+ अगली पीढ़ी के models तक scale किया जा सकता है
    • Oasis की end-to-end Transformer संरचना Sohu पर efficient है, और 100B+ parameter models में भी 10 गुना से अधिक users को संभाल सकती है

अभी बची हुई सीमाएँ

  • लंबी दूरी के वीडियो में blur, अनिश्चित objects की temporal consistency, domain generalization, inventory का सूक्ष्म नियंत्रण, objects का सूक्ष्म नियंत्रण, और लंबे time span के लिए सीमित memory जैसी कमियाँ अभी बाकी हैं
  • architecture configuration, data, और model size पर sensitivity analysis के बाद यह परिकल्पना रखी गई है कि कई समस्याएँ model और dataset scaling से हल हो सकती हैं
  • बड़े models विकसित होने पर भी latency और cost का संतुलन बनाए रखने के लिए नई inference techniques की आवश्यकता होगी

1 टिप्पणियां

 
GN⁺ 2024-11-03
Hacker News की राय
  • अगर आप Minecraft में सपना देख रहे हों, तो शायद कुछ ऐसा ही महसूस होगा
    object persistence की कमी की वजह से यह सचमुच सपने जैसा लगता है। lighting level भी दिलचस्प हैं; अगर आप किसी अंधेरी जगह को देर तक देखते रहें या “पानी के अंदर” चले जाएँ और स्क्रीन काली हो जाए, तो काली स्क्रीन के अलावा किसी दूसरी स्थिति में लौटना मुश्किल हो जाता है। मैंने एक बार खेलने पर इसमें सफलता नहीं पाई। यह काफ़ी अजीब एहसास है

  • मुझे समझ नहीं आता कि इस तरह से गेम को design और release कैसे किया जाएगा। आप model weights को सीधे सेट करके गेम design नहीं कर सकते
    शायद कभी object persistence या long-term state जैसे गायब हिस्सों के बिना भी गेम की नकल कर पाएँगे, लेकिन inference engine चलाने की लागत, जिस game engine की यह नकल कर रहा है, उससे ज़्यादा महंगी होने की संभावना है। लंबे समय से AI में काम करने वाले व्यक्ति के तौर पर मुझे सच में जिज्ञासा है कि यह तकनीक कहाँ उपयोगी होगी

    • सही। इसलिए अगले model का मुख्य लक्ष्य ऐसी स्थिति तक पहुँचना है जहाँ आप prompt से नई दुनिया को “code” कर सकें
      मैं सहमत हूँ कि ये tools तब बेहद उपयोगी बनेंगे जब creators इस system के ऊपर नई worlds या games “develop” कर सकें और users उन worlds से interact कर सकें। अंततः इसे game engine जैसी “API” देनी होगी। creator दुनिया बनाता है और user उससे interact करता है। अगर AI वाकई यह भूमिका निभा सके, तो 1) “यहाँ उड़ता हुआ गुलाबी हाथी जोड़ो” जैसा कहकर worlds और games बनाना कहीं आसान हो सकता है, और 2) users ऐसी worlds से interact कर सकेंगे जो हर play session के हिसाब से बदलती हैं, इसलिए सचमुच अनंत worlds संभव होंगी। क्या हम वहाँ पहुँच गए हैं? बिल्कुल नहीं। Oasis v1 पहला proof of concept है, और v2 के लिए बस थोड़ा और इंतज़ार करें ;)
    • ज़ाहिर है यह tool तुरंत release करने लायक game नहीं बनाएगा। AI अभी बहुत दूर है
      लेकिन “design” के लिहाज़ से, भले ही यह बहुत GPU इस्तेमाल करे, games को जल्दी prototype करने में यह कितना उपयोगी हो सकता है, यह देखना मुश्किल नहीं है। ऐसे papers उस दिशा में सिर्फ़ stepping stones हैं
    • visual artifacts परेशान कर रहे थे। सोच रहा हूँ कि क्या किसी ने rasterization से पहले के game engine output, जैसे mesh/material, camera, या raw OpenGL calls, पर training कराई है
      अगर AI वास्तविक renderer या engine के लिए inputs generate करे, तो visual fidelity की समस्या हल हो सकती है
    • मुझे यह आसान लगता है। AI images में जो तरीका अपनाया गया था, वही video game world models पर लागू करना होगा
      कई models को मिलाएँ, हर game “world model” के टुकड़े लें और combine करें, तो यह लगभग पूरी तरह नया game बनाने जैसा हो जाएगा। object persistence या long-term state जैसे गायब हिस्सों को variables के बहुत छोटे set से जोड़ा जा सकता है। जब पहले से पूरा पिछला frame और user input weights में डाले जा रहे हैं, तो simplified game state भी साथ में न डाल पाने की कोई वजह नहीं दिखती
    • Avatar जैसी movie लेकर उसे कुछ हद तक interactive experience में बदलना संभव लग सकता है
  • वे इसे “पूरी तरह AI-generated video game” कहते हैं, लेकिन webpage पर Ctrl-F करके देखा तो Minecraft 0 बार मिला। समझ नहीं आया क्यों
    यह video game नहीं, बल्कि असली video game की घटिया copy है, और उसका नाम लेने या credit देने की कोशिश तक नहीं की गई

    • यह legal issues से बचने की दिलचस्प कोशिश लगती है
      “Minecraft” नहीं कह सकते क्योंकि वह Microsoft का trademark है, लेकिन लगता है कि वे Minecraft images को training data के तौर पर इस्तेमाल करना ठीक मानते हैं। Microsoft सहित हर कोई diffusion models train करने के लिए proprietary data इस्तेमाल कर रहा है। समस्या यह है कि output साफ़ तौर पर Minecraft जैसा दिखता है, लेकिन Microsoft के सामने भी यह दिक्कत है कि safeguards के बावजूद Bing और DALL-E trademark वाली चीज़ों से साफ़ तौर पर मिलती-जुलती images generate करते हैं
    • Architecture section के दूसरे paragraph में Minecraft एक बार आता है। वहाँ लिखा है, “...We train on a subset of open-source Minecraft video data collected by OpenAI[9].”
      पता नहीं यह मूल comment के बाद जोड़ा गया था या नहीं
    • अजीब है। https://diamond-wm.github.io/ से तुलना करें, जहाँ Counter Strike का स्पष्ट उल्लेख है, तो और भी अजीब लगता है
      अगर कोई scientific work किसी work का उपयोग करता है और credit नहीं देता, तो यह academic dishonesty है। वे किसी और dataset पर train कर सकते थे, लेकिन जो भी source इस्तेमाल किया हो, उसे cite करना चाहिए
    • यह अजीब है कि वे ऐसे बात करते हैं जैसे model कोई भी environment generate कर सकता है, फिर भी demo सिर्फ़ वही game दिखाता है जिसके लिए सबसे ज़्यादा data उपलब्ध है
  • यह सचमुच शानदार है, और ऐसे models को तेज़ी से आगे बढ़ते देखना भी अच्छा है। हालांकि मैं जानना चाहूँगा कि long-term state कैसे काम करेगी
    उदाहरण के लिए base बनाकर बाद में वापस आना, पारंपरिक code से enforce होने वाले game rules, multiplayer, saved game load करना जैसी guided state कैसे संभाली जाएगी, यह स्पष्ट नहीं है। मूल रूप से external state और memory/simulation अलग चीज़ें हैं, इसलिए सिर्फ़ context window बढ़ाने या model बड़ा करने से शायद काम नहीं चलेगा। हाँ, उससे मदद ज़रूर मिल सकती है। वैसे भी, ऐसे models जल्द ही goal-oriented tasks की imagination में इस्तेमाल होते दिखेंगे। जैसे कोई agent जिसे computer पर कोई specific image खोजनी है, वह current state और desired state के बीच का path लगातार imagine करे। यह model user input लेता है, लेकिन ऐसा agent उस input तक को imagine करेगा। मेरी समझ के अनुसार कुछ robot control networks में pixels के बिना पहले से कुछ ऐसा हो रहा है

    • इस demo में state का लगभग कोई निशान भी नहीं है। “left turn” को एक पूरा चक्कर जितनी देर दबाए रखें, तब भी आप शुरुआती जगह पर वापस नहीं आते
      कुछ चक्कर लगाने के बाद details गायब हो जाती हैं और आप खाली समुद्र के बीच रह जाते हैं। इस technology से Minecraft तो दूर, Mario का playable version भी कभी नहीं बन पाएगा लगता है
  • यह video game नहीं है; यह ज़्यादा एक तेज़ Minecraft screenshot simulator जैसा है, जिसमें हर frame के बीच prompt input state और पिछला frame होते हैं
    कुछ हद तक consistency जैसी चीज़ है

  • मूल रूप से model को Minecraft पर train किया गया है। यह बिल्कुल general-purpose नहीं है
    game prompt से नहीं निकला है; संभवतः यह Minecraft gameplay के बड़े dataset और fine-tuning से निकला है। मैं ऐसा काम देखना चाहूँगा जहाँ prompt से दुनिया या game निकलें

    • जल्द आने वाले Oasis v2 का इंतज़ार करें :)
      संदर्भ के लिए, मैं Oasis team से हूँ
  • अगर खेलते समय user को frame buffer पर सीधे draw करने दिया जाए और उसे वापस input में डाल दिया जाए, तो काफ़ी दिलचस्प चीज़ निकल सकती है

    • Minecraft को हाथ से draw करना सच में बहुत मुश्किल है, इसलिए शायद यह बहुत बुरी तरह टूट जाएगा
  • queue बहुत लंबी थी, इसलिए मैंने छोड़ दिया। जानना चाहता हूँ कि क्या model खुद pixels generate करता है, या सिर्फ़ environment generate करके उसे “traditional” तरीके से render करता है

    • अगर यह traditional तरीके से render होने वाला environment generate कर रहा है, तो थोड़ी देर दूसरी तरफ़ देखने के बाद कुछ नया फिर से generate करने के बजाय object persistence होने की संभावना है: https://oasis-model.github.io/3_second_memory.webp
    • हर pixel generate होता है। user action अंदर जाता है और pixels बाहर आते हैं, बीच में सिर्फ़ Transformer है :)
      यह दिलचस्प क्यों है—आज के हिसाब से शायद बहुत दिलचस्प न लगे। Oasis v1 सिर्फ़ proof of concept है। लेकिन भविष्य के बारे में सोचें, सचमुच कुछ महीनों बाद आने वाले Oasis के अगले versions के बारे में, तो आप ऐसी स्थिति की कल्पना कर सकते हैं जहाँ आप जो भी pixels देखते हैं वे generate किए गए हों, यहाँ तक कि इस message को पढ़ते हुए दिख रहे pixels भी। यह इंसान और मशीन के बीच communication का नया interface है। अगर LLM chat में इसलिए दिलचस्प है क्योंकि वह इंसान और मशीन को इंसानों के परिचित तरीके, यानी बातचीत, से interact करने देता है, तो यहाँ computer दुनिया को हमारे देखने के तरीके से देख सकता है और हमें फिर उसी परिचित तरीके से दिखा सकता है। संक्षेप में, computer से “pink elephant बनाओ” कहें और कल्पना करें कि वह आपके खेले जा रहे game में तुरंत दिखने लगे
    • यह pixels generate करता है। नीचे की धुंधली UI सहित
  • शायद Mario game पर model train कराना चाहिए, ताकि Nintendo को “अच्छे मकसद” के लिए लड़ने पर मजबूर किया जा सके