- 1 लाख घंटे के रोबोट-स्वतंत्र UMI trajectories पर pre-training करने के बाद वास्तविक रोबोट डेटा से follow-up training की गई, जिससे रोबोट policy model में डेटा की कमी को कम करने वाला foundation model बना
- 1,700 से अधिक scenarios को automatic annotation देकर सामान्य action generation क्षमता सीखी गई, और follow-up training में रोबोट form factor और natural language commands के साथ align किया गया
- Pre-training data और model बढ़ने के साथ validation action error घटा, और follow-up training के बाद अज्ञात environments और objects पर मापा गया वास्तविक रोबोट success rate भी लगातार बढ़ा, saturation के कोई संकेत नहीं थे
- प्रति task औसतन 10 घंटे से कम demonstrations के साथ phone packaging, printer replenishment, laundry loading, और box packaging में कुल success rate 75% दर्ज किया गया, और औसतन 40 घंटे से कम पर यह 85% तक पहुंचा
- RoboCasa, RoboCasa365, VLABench, और RoboDojo सभी में सर्वोच्च performance दर्ज हुई, जिससे बड़े पैमाने की UMI pre-training का generalization effect वास्तविक रोबोट adaptation और standard evaluations तक पहुंचा
रोबोट डेटा barrier को पार करने वाली 2-stage training
- Language और vision-based models में data, parameters, और compute बढ़ने के साथ performance सुधरी है, लेकिन robot policy models की scaling बड़े पैमाने के high-quality data की कमी के कारण सीमित रही है
- Xiaomi-Robotics-1 बड़े पैमाने के robot-independent UMI data पर pre-training और अपेक्षाकृत कम वास्तविक robot data पर follow-up training वाली 2-stage training approach का उपयोग करता है
- इससे robot policy models के scaling pattern और pre-training में हुए सुधारों के वास्तविक robot performance में transfer का मूल्यांकन किया गया
Pre-training और follow-up training data की संरचना
- Pre-training data 1 लाख घंटे की UMI trajectories से बना है
- इसमें घर, commercial facilities, industrial sites, और outdoor spaces सहित 1,700 से अधिक scenarios और विविध tasks शामिल हैं
- Trajectories को fixed-length segments में बांटने के बाद हर segment में scene state changes को भाषा में दर्ज करने वाली automatic annotation pipeline विकसित की गई
- Follow-up training में कई robot form factors को कवर करने वाला dataset इस्तेमाल किया गया
- स्वयं इकट्ठा किया गया वास्तविक robot data
- filtered open source robot data
- curated high-quality UMI data
- स्वयं के data में वास्तविक घरों में इकट्ठा किए गए 7,200 घंटे से अधिक वास्तविक robot tasks शामिल हैं
- Sofa tidying, shoe cabinet sorting, kitchenware storage जैसे tasks शामिल हैं
- Follow-up training के लिए UMI data में time segments और command prompts को इंसानों ने manually annotate किया
- यह pre-training data में इस्तेमाल किए गए automatically generated state transition descriptions से अलग तरीका है
UMI pre-training और automatic annotation
- Pre-training वह चरण है जिसमें विविध वास्तविक environments और tasks से सामना कराकर सामान्य action generation representations सीखे जाते हैं
- Data scale के कारण manual annotation कठिन था, इसलिए शक्तिशाली vision-language model (VLM) का उपयोग करने वाली automated pipeline बनाई गई
- लंबे videos को fixed-length clips में विभाजित किया गया
- हर clip में gripper और interacting object की state changes को VLM ने वर्णित किया
- वास्तविक manipulation trajectories और सटीक language descriptions को मिलाकर बड़े पैमाने का corpus बनाया गया
- Model को language में वर्णित state transitions के अनुरूप scene बदलने वाली actions generate करना सिखाया गया
- Data और model size बढ़ने के साथ validation action error लगातार घटता दिखा, जो स्पष्ट scaling pattern है
वास्तविक रोबोट और natural language commands के साथ alignment
- Follow-up training pre-training से मिली action generation ability को दो axes पर align करती है
- Robot form factor alignment: high-quality multi-form-factor वास्तविक robot data से सामान्य action generation ability को physical robots पर map किया जाता है
- Command alignment: scene state transition descriptions को input लेने वाले model को natural language commands समझकर सीधे execute करने में बदला जाता है
- Follow-up training पूरा कर चुका model बिना अलग tuning के विभिन्न वास्तविक mobility और manipulation tasks में इस्तेमाल किया जा सकता है
- Pre-training के scaling effect का transfer जांचने के लिए unseen environments और object instances में वास्तविक robot performance का evaluation किया गया
- Pre-training data और model size बढ़ने के साथ वास्तविक robot success rate भी लगातार और predictably बढ़ा
- ज्यादा मजबूत pre-trained models ने follow-up training के बाद भी ज्यादा उच्च वास्तविक robot performance दिखाया
- Data और model scale बढ़ाने से success rate में सुधार में saturation के संकेत नहीं थे
कम data से नए tasks सीखना
- Xiaomi-Robotics-1 प्रति task केवल कुछ घंटों की वास्तविक robot demonstrations से complex नए tasks में adapt करता है
- Phone packaging, printer replenishment, laundry loading, और box packaging को evaluation tasks के रूप में इस्तेमाल किया गया
- प्रति task औसतन 10 घंटे से कम demonstrations पर कुल success rate 75% रहा, जो समान data budget में baseline model Ï0.5 के 40% से काफी आगे है
- Phone packaging: XR-1 70%, Ï0.5 30%
- Printer replenishment: XR-1 70%, Ï0.5 20%
- Laundry loading: XR-1 80%, Ï0.5 40%
- Box packaging: XR-1 80%, Ï0.5 70%
- प्रति task औसतन 40 घंटे से कम तक बढ़ाने पर कुल success rate XR-1 85%, Ï0.5 53% तक बढ़ा
- Phone packaging: XR-1 80%, Ï0.5 40%
- Printer replenishment: XR-1 60%, Ï0.5 20%
- Laundry loading: XR-1 100%, Ï0.5 50%
- Box packaging: दोनों models 100%
चार simulation benchmarks में performance
- Generalization पर जोर देने वाले 4 प्रमुख simulation benchmarks में सभी पर सर्वोच्च performance दर्ज की गई
- RoboCasa: औसत success rate 74.5%, दूसरे स्थान के 72.6% की तुलना में 2.6% सुधार
- RoboCasa365: 57.4%, दूसरे स्थान के 46.6% की तुलना में 23.2% सुधार
- VLABench: 59.1%, दूसरे स्थान के 53.2% की तुलना में 11.1% सुधार
- RoboDojo: 13.93%, दूसरे स्थान के 8.80% की तुलना में 58.3% सुधार
- Pre-training से मिले generalization और scaling effects standard simulation evaluations में भी जारी रहे
Scaling results और उपयोग का दायरा
- बड़े पैमाने की UMI pre-training robot data bottleneck को कम करती है, और वास्तविक robot व command alignment सामान्य action generation ability को physical robots में transfer करता है
- Pre-training data और model scale के अनुसार performance में सुधार follow-up training के बाद वास्तविक robots की immediately usable performance में भी सीधे दिखता है
- तैयार foundation model कम data से नए tasks में adapt होते हुए, generalization का मूल्यांकन करने वाले 4 simulation benchmarks में भी सर्वोच्च performance हासिल करता है
- वास्तविक उपयोग case के रूप में unedited suitcase packing video भी जारी किया गया
1 टिप्पणियां
Hacker News की राय
यहाँ की निराशावादी प्रतिक्रियाएँ समझ में ही नहीं आईं; वीडियो देखते हुए मैं पूरी तरह मुस्कुरा रहा था। आखिरकार कपड़े धोने वाला रोबोट आ गया, और कम-से-कम मॉडल को मुफ्त में जारी किया गया है, है ना। यही वह भविष्य है जिसकी हम उम्मीद कर रहे थे, और robotics का इस्तेमाल ठीक इसी तरह होना चाहिए
इस वीडियो में कई ऐसे काम शामिल हैं जो पारंपरिक रूप से बेहद कठिन माने जाते हैं, इसलिए अगर यह प्रभावशाली नहीं लगता तो शुक्र मनाना चाहिए कि आपको 10 साल पहले इसे खुद बनाना नहीं पड़ा
इसमें दोनों हाथों का coordination, चलायमान body, deformable objects, बैग की zipper जैसी पतली manipulation points, और एक साथ कई चीज़ें पकड़ने जैसी क्रियाएँ शामिल हैं। इनमें से हर एक पर perception या manipulation के क्षेत्र में अलग-अलग शोध हुए हैं, और हर विषय पर कई PhD thesis निकल सकती हैं
दो-हाथ वाले रोबोट को देखकर लगता है कि अगर tentacle-like grip जैसी अलग क्षमता वाला तीसरा हाथ हो तो बहुत से काम आसान हो जाएँ। अंग जितने बढ़ते हैं, समस्याएँ भी बढ़ती हैं, लेकिन किसी वस्तु को पकड़कर घुमाने का एक अतिरिक्त तरीका मिलना बड़ा फ़ायदा है
अगर रोबोट कपड़ों को थोड़ा सिकुड़ा हुआ और ढीला-ढाला मोड़े, तब भी उसे बारीकी से मोड़ने और इस्त्री करने से ज़्यादा सुविधाजनक मानकर स्वीकार करने के तरीके को मैं Slopfold कहना चाहूँगा
प्रगति की रफ़्तार बेहद तेज़ है, और AI भविष्य पर राज करेगा। मुझे लगता है कि हमने अभी सिर्फ़ उसकी संभावनाओं की सतह को खरोंचा है, लेकिन निराशावादी नज़रिये से देखें तो Bill Joy की भविष्यवाणी दूरदर्शी लगती है
https://www.wired.com/2000/04/joy-2/
AI के अनुमानित भविष्य में सबसे रोमांचक हिस्सा घरेलू काम का automation है। पूर्वी देशों में घरेलू मदद अपेक्षाकृत सस्ती और आसानी से उपलब्ध हो सकती है, लेकिन पश्चिम में cleaner या housekeeper रखना लगभग विलासिता जैसा है। मैं हर हफ़्ते घर सँभालने में बहुत समय लगाता हूँ, इसलिए उस समय को वापस पाने का इंतज़ार है
बिना संपादन का वीडियो होने से यह और भी बेहतर लगता है। सीढ़ियाँ या तंग दरवाज़ों जैसी कई चीज़ें गिनाई जा सकती हैं जो यह नहीं कर सकता, लेकिन जो काम यह पहले से कर सकता है वही काफ़ी हैरान करने वाले हैं, और chat panel की वजह से interactivity भी अच्छी लगती है
non-humanoid robots डिज़ाइन करने की दिशा सही लगती है। आगे चलकर tools और appliances भी इंसानों और रोबोटों के साथ साझा उपयोग के लिए बदलेंगे, और जूते के बैग की zipper pull जैसी चीज़ें बहुत ज़्यादा precision माँगती हैं
वास्तविक दुनिया के कामों से सीखने में किए गए विशाल निवेश का फ़ायदा उठाते हुए सस्ते humanoids की agility, battery life और ताकत का लगातार सुधरना, मौजूदा task-specific robots के हिसाब से रोज़मर्रा की लाखों चीज़ों को फिर से डिज़ाइन करने से ज़्यादा संभव लगता है
मैं मच्छरों को खत्म करने वाले insect-like robot swarms, पाइप ठीक करने वाले snake robots, और सतह साफ़ करने वाले spider robots चाहता हूँ
कुछ साल बाद Home Assistant और LLM घर से बाहर रहने पर भी घरेलू कामों का coordination कर सकते हैं। LLM घर के सामान की सूची बना सकता है और vacuum cleaner व रोबोट को भेजकर चीज़ें व्यवस्थित करवा सकता है
multimodal LLM फ़ोटो का विश्लेषण करके dishwasher या washing machine में जाने वाली चीज़ों और polish की ज़रूरत वाली चीज़ों में फ़र्क कर सकता है, और wardrobe organize करना, बिस्तर ठीक करना, तथा plants की देखभाल भी कर सकता है। solar panels ऊर्जा देते रहें और यह पूरे दिन काम करे
मैं full-time घर का काम संभालता हूँ, इसलिए मुझे यह रोबोट सच में चाहिए। मुझे कपड़े मोड़ना पसंद नहीं, इसलिए मैं इसे हमेशा टालता रहता हूँ; अगर यह सिर्फ़ मोड़ दे और washing machine में डालने की क्षमता न भी हो, तब भी मेरे लिए काफ़ी है