- Black Forest Labs और mimic robotics ने इमेज·वीडियो·ऑडियो को संयुक्त रूप से प्रशिक्षित किए गए FLUX 3 backbone में रोबोट व्यवहार पूर्वानुमान को जोड़कर, Audi के प्रोडक्शन साइट पर परीक्षण और तैनात किया गया FLUX-mimic विकसित किया
- पूरे प्रशिक्षण कंप्यूट का 95% से अधिक हिस्सा लेने वाले वीडियो पूर्वानुमान के जरिए इसने संपर्क, गति, वजन और कारण-परिणाम संबंध सीखे, और निम्न-आयामी रोबोट व्यवहार को भी उसी भौतिक वास्तविकता को दर्शाने वाले अतिरिक्त modality के रूप में संभाला
- व्यवहार पूर्वानुमान जोड़ने के तुरंत बाद वीडियो generation की गुणवत्ता अधिकतम 10% तक गिरी, लेकिन 3,500 steps के बाद पहले के स्तर पर लौट आई, जिससे यह पुष्टि हुई कि एक ही backbone generation और व्यवहार पूर्वानुमान दोनों कर सकता है
- Self-Flow से generation और representation learning को एकीकृत कर और हल्का behavior decoder जोड़कर, एकल NVIDIA RTX 5090 पर backbone processing 80ms से कम और कुल रोबोट प्रतिक्रिया समय 101ms हासिल किया गया
- सामान्य वीडियो और manipulation tasks को बड़े पैमाने पर सीखने वाला world model कम demonstrations से नए tasks के अनुकूल हो जाता है और विफलता के बाद फिर से कोशिश करता है, इसलिए लचीले parts और precision manipulation जैसे उन production tasks में उपयोगी है जहाँ पारंपरिक automation की लागत अधिक थी
एक ही backbone से content generation और robot control
- FLUX 1·FLUX 2 जहाँ इमेज generation पर केंद्रित थे, वहीं FLUX 3 इमेज·वीडियो·ऑडियो को शुरू से साथ में प्रशिक्षित कर audiovisual content को संयुक्त रूप से generate करता है
- Black Forest Labs ने mimic robotics को FLUX 3 का शुरुआती संस्करण दिया और दोनों कंपनियों की robot learning·deployment तथा foundation model विशेषज्ञता को मिलाकर FLUX-mimic विकसित किया
- mimic अपने स्वयं के robots, robot learning, परिष्कृत manipulation, और production environment deployment की जिम्मेदारी लेता है
- Black Forest Labs visual-based models और multimodal learning·modeling क्षमता प्रदान करता है
- FLUX-mimic, FLUX 3 backbone पर आधारित general-purpose manipulation के लिए एक video-action model है, और mimic की full-stack deployment system में एकीकृत है
- वही backbone इमेज·वीडियो·ऑडियो content generate करने के साथ-साथ Physical AI में actions भी करता है
वीडियो पूर्वानुमान से सीखी जाने वाली भौतिक दुनिया
- FLUX 3 के प्रशिक्षण कंप्यूट का 95% से अधिक वीडियो पूर्वानुमान में इस्तेमाल होता है
- यथार्थवादी वीडियो बनाने के लिए संपर्क, गति, वजन, और कारण-परिणाम को सीखना पड़ता है, और इन्हें गलत संभालने पर आउटपुट वीडियो भी अप्राकृतिक हो जाता है
- दुनिया को सही ढंग से render करने की प्रक्रिया, दुनिया कैसे काम करती है इसे सीखने की प्रक्रिया से जुड़ी है
- ऑडियो, 720p ध्वनि-सहित वीडियो में tokens का 0.5% से कम हिस्सा लेने वाली निम्न-आयामी modality है
- वीडियो को समझने वाला मॉडल होंठों की गति के साथ synchronized speech और भौतिक घटनाओं से जुड़े sound effects की causal relation सीख सकता है
- रोबोट व्यवहार भी visual observations से घनिष्ठ रूप से जुड़ा एक निम्न-आयामी state representation है
- actions·audio·video frames एक ही भौतिक वास्तविकता को आंशिक रूप से दर्शाते हैं
- behavior prediction, अलग foundation model बनाने के बजाय मौजूदा world model में एक और observation mode जोड़ता है
behavior learning के बाद वापस आई generation quality
- बड़े पैमाने के प्रशिक्षण में behavior prediction जोड़ने पर text-to-video और image-to-video generation के human evaluation scores शुरुआत में अधिकतम 10% घटे
- मॉडल ने behavior space की संरचना सीखी और internal world representation को align किया, जिससे गुणवत्ता वापस आई, और 3,500 steps के बाद पहले वाली video generation क्षमता तक पहुँचते हुए behavior भी predict करने लगा
- actions को input-output में एकीकृत करने के दौरान अस्थायी भ्रम हुआ, लेकिन इससे मौजूदा क्षमताओं की क्षमता स्थायी रूप से कम नहीं हुई
- video generation और behavior prediction के लिए अलग foundation models की जरूरत नहीं है; वही single backbone दोनों काम करता है
world representation से action decode करने वाली संरचना
- FLUX-mimic, FLUX 3 द्वारा video generation के लिए सीखी गई internal world representation से robot actions decode करता है
- mimic-video में पहले इस्तेमाल किए गए तरीके के अनुसार FLUX के video prediction path से intermediate features निकाले जाते हैं, और उनके ऊपर हल्का behavior decoder प्रशिक्षित किया जाता है
- प्रदर्शन दो आपस में जुड़े तत्वों पर निर्भर करता है
- world model quality: अगर दुनिया कैसे चलती है यह समझ में नहीं आता, तो सटीक simulation भी मुश्किल है, और यह generation quality से सीधे जुड़ा है
- representation quality: अगर modalities के बीच causal relations feature space में non-linear रूप से उलझे हों, तो behavior decoder को उन्हें raw inputs जितनी कठिनाई से समझना पड़ता है
- generative models उच्च-गुणवत्ता simulation और बढ़ते compute के साथ पूर्वानुमेय scaling laws देते हैं, लेकिन वे विशेष representation learning तरीकों की तुलना में कम अलग-अलग representations बना सकते हैं, जिससे world understanding की जरूरत वाले downstream tasks में उपयोगिता सीमित हो सकती है
Self-Flow से एकीकृत generation·representation learning
- Self-Flow generation learning और representation learning को एक ही framework में एकीकृत करता है
- लागू करने के बाद world model और representation दोनों की गुणवत्ता साथ में सुधरती है
- video·image·audio generation quality से मापे गए world model performance में सुधार होता है
- simulated robot control tasks की success rate से मापी गई representation quality भी बेहतर होती है
- FLUX 3, Self-Flow का विस्तार कर शुरू से ही व्यापक world dynamics और manipulation capabilities सीखता है
- सामान्य video content के करोड़ों घंटे
- human और robot manipulation पर केंद्रित video content के लाखों घंटे
- इस बड़े पैमाने के प्रशिक्षण से प्रयोगशाला के Self-Flow परिणामों को वास्तविक production·logistics environments तक बढ़ाया गया
फैक्ट्री tasks और benchmark performance
- mimic ने FLUX-mimic को वास्तविक फैक्ट्री कार्यों में तैनात किया
- structured trays में parts रखना
- कम खाली जगह वाले fixtures में electronic control units डालना
- parts assembly
- धागे·cables जैसी मुलायम और लचीली सामग्रियों का handling
- FLUX backbone को पूरी तरह freeze करने पर भी behavior decoder ने पिछले vision-language-action models से बेहतर प्रदर्शन दिया, जबकि पहले के models इस setup में task पूरा नहीं कर सके
- backbone और behavior decoder को साथ में fine-tune करने पर FLUX-mimic ने शीर्ष-स्तरीय task success rate दर्ज की
- बड़े पैमाने का प्रशिक्षण backbone को world और behavior का ज्ञान देता है, और Self-Flow उस ज्ञान को feature representations से आसानी से decode करने योग्य बनाता है
कम demonstrations से सीखना और विफलता से उबरना
- अगर भौतिक नियम पहले से सुलभ representation में मौजूद हों, तो नए task के लिए adaptation दुनिया कैसे काम करती है यह फिर से सीखने के बजाय, task को मौजूदा ज्ञान से जोड़ने की प्रक्रिया बन जाता है
- Self-Flow प्रयोगों में समान success rate तक पहुँचने के लिए जरूरी behavior prediction training steps, Self-Flow के बिना video model की तुलना में आधे रह गए
- mimic-video पेपर में video-action model ने vision-language-action model की तुलना में अधिकतम 10 गुना अधिक sample efficiency दिखाई, और FLUX-mimic दोनों प्रभावों को जोड़ता है
- अगर रोबोट किसी वस्तु को पकड़ने में विफल हो जाए, तो वह अपनी pose सुधारकर फिर से पकड़ सकता है और task पूरा कर सकता है; यानी प्राकृतिक failure recovery संभव है
- क्योंकि हर प्रकार की विफलता को demonstration data में शामिल नहीं किया जा सकता, इसलिए बिना दिखाए गए recovery behaviors उस मॉडल से आते हैं जिसने पहले से दुनिया के काम करने का तरीका सीखा है
101ms में प्रतिक्रिया देने वाली robot system
- वास्तविक वातावरण में मॉडल को पर्यावरण के बदलाव की गति के अनुरूप कार्य करना होता है, और FLUX-mimic की अधिकांश compute cost इसके सबसे बड़े घटक backbone में आती है
- अच्छी तरह संरचित world representation समान performance को कम parameters से हासिल करने देती है, जिससे छोटा और तेज backbone इस्तेमाल किया जा सकता है
- optimized backbone एकल NVIDIA RTX 5090 पर input से world representation generation तक 80ms से कम समय लेता है, जो मानव की visual reaction time के समान स्तर का है
- mimic ने पूरे deployment stack में अतिरिक्त latency कम करने के लिए निम्न तत्वों को optimize किया
- behavior decoder
- sensors·model·actuators के बीच inter-process latency
- prediction और execution को overlap कर robot jitter रोकने वाला real-time chunking
- सभी optimizations लागू करने के बाद standalone robot system का अंतिम response time 101ms है
Audi production site में उपयोग
- Audi ने उच्च automation स्तर के बावजूद लचीले parts और precision manipulation tasks को अब तक मैन्युअल रूप से संभाला है
- premium product production में variants अधिक होने के कारण, पारंपरिक तरीके से programmed robot cells को हर case के लिए फिर से डिजाइन करना महंगा पड़ता है
- learning-based systems इस cost structure को बदलते हैं
- Audi Production Lab ने mimic के साथ सहयोग कर FLUX-mimic का परीक्षण और deployment किया
- यह ऐसे जटिल soft-object manipulation करता है जो मौजूदा robots से संभव नहीं था
- इसे employee support, efficiency improvement, और production·logistics में flexible automation के विस्तार के लिए इस्तेमाल किया जा सकता है
- FLUX-mimic की sample efficiency और robustness task-specific engineering से नहीं, बल्कि FLUX 3 backbone और decodeable representations से आती है, जो tasks·industries·hardware के बीच transfer को support करती हैं
- visual intelligence पर आधारित एक ही मॉडल इमेज·वीडियो·ऑडियो generate करने के साथ-साथ production line के robots को भी चलाता है
1 टिप्पणियां
Hacker News की राय
ऐसा लगता है कि अच्छी तरह trained multimodal video generation model के भीतर दुनिया का representation model बनता है, और उसे extract करके robots पर apply करने पर भी वह अच्छी तरह काम करता है
यह विचार नया नहीं है कि video model पदार्थ, रोशनी और दुनिया को समझता है, लेकिन video lab का robotics lab में बदलना दुर्लभ रहा है। यह एक business path हो सकता है: video generation के जरिए scale बढ़ाना और फिर उसी क्षमता से robots को train करना
BFL का हाथ भी दिलचस्प है, जैसे glove के अंदर कई devices छिपे हों। Xiami का Robotics-1 सामान्य gripper और gripper-type glove से training videos बनाता है, लेकिन BFL model को ऐसा hardware जरूरी नहीं लगता। चूंकि hardware कठिन क्षेत्र है, आगे उनका approach देखना दिलचस्प होगा
https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-f...
Luma Labs https://lumalabs.ai/news/luma-open-physical-ai-lab
Runway https://runway.com/product/robotics
करीब 3 मिनट 30 सेकंड पर robot arm का तीन कोशिशों के बाद window molding को वापस fit करना काफी हैरान करने वाला था। ऐसा failure के बाद problem solving पहली बार देखा; जिज्ञासा है कि क्या यह नई तकनीक है
“दुनिया की समझ की जरूरत वाले tasks के लिए कम अलग किए गए representations कम उपयोगी होते हैं” वाली व्याख्या में, ‘ज्यादा entangled’ जैसी अवधारणा को जानबूझकर कम अलग किए गए representations कहना मजेदार है। वास्तविक दुनिया समझाते हुए concept को भी और entangle कर देना LLM-जैसी अभिव्यक्ति लगती है
तकनीक इतनी आगे बढ़ गई है, लेकिन films पहले से भी खराब लगती हैं—यह दुखद है। अच्छी चीजें खोजने के लिए अक्सर दशकों पुरानी films देखता हूं; उनमें हास्यास्पद puppets इस्तेमाल होते थे फिर भी story structure 1,000 गुना बेहतर था
यह केवल venture capital की समस्या नहीं है, बल्कि तथाकथित Hollywood No से जुड़ा है। उल्टा Hollywood No खुद भी समस्या हो सकता है, और games industry में इसे toxic positivity कहा जाता रहा है
European startups के बीच सहयोग देखकर अच्छा लगा
यह भविष्य भी है और पहले से वर्तमान भी। कृपया इसे software development/engineering के बाहर मौजूद अपने जानकारों से भी share करें
हम उस संकट की ओर सीधे दौड़ रहे हैं, जहां production means के मालिक न होने वाले इंसानों की value और घटती जाएगी। आगे अंधकारमय समय आता दिख रहा है