- OK-Robot एक खुला मॉड्यूलर रोबोट framework है, जिसका लक्ष्य नए घरेलू वातावरणों में सिर्फ भाषा निर्देशों से वस्तुओं को खोजकर उठाने और ले जाने वाले pick-and-drop कार्यों को zero-shot तरीके से करना है
- यह vision-language model (VLM), navigation primitives और grasping primitives को जोड़कर अलग training के बिना object recognition, movement और manipulation को एक साथ पिरोता है
- New York City के 10 असली घरों में 171 tasks का मूल्यांकन किया गया, और पूरी तरह नए घरों में 58.5% success rate दर्ज हुआ
- साफ और कम बिखरे हुए वातावरणों में success rate बढ़कर 82% हो गया, और Open Vocabulary Mobile Manipulation (OVMM) में पिछले काम की तुलना में लगभग 1.8 गुना performance दिखी
- मुख्य failures object search, कठिन manipulation poses और hardware issues से आए, जिससे पता चलता है कि open knowledge models और robot modules का बारीक integration performance तय करता है
Framework की संरचना और लक्ष्य
- OK-Robot किसी भी घर में zero-shot, language-conditioned pick-and-drop tasks करने के लिए एक खुला मॉड्यूलर framework है
- System तीन components को जोड़ता है
- Vision-language model (VLM): भाषा query आधारित object detection
- Navigation primitives: mobile system movement control
- Grasping primitives: विभिन्न objects का manipulation
- अलग training stage के बिना object recognition, movement और grasping को integrate करके वास्तविक घरेलू tasks करने वाला system-first approach इस्तेमाल किया गया है
- Project materials:
असली घरों में evaluation और failure factors
- New York City के 10 घरेलू वातावरणों में 171 pick-and-drop tasks आज़माए गए
- पूरी तरह नए घरों में success rate 58.5% था, और Open Vocabulary Mobile Manipulation (OVMM) में पिछले काम की तुलना में लगभग 1.8 गुना performance दिखी
- Success rate: {p:58}
- ज़्यादा साफ और कम बिखरे हुए वातावरणों में success rate बढ़कर 82% हो गया
- व्यवस्थित वातावरण में success rate: {p:82}
- Failure causes long-tail distribution में फैले हुए हैं, और तीन सबसे बड़े कारण ये हैं
- semantic memory में ले जाने के लिए सही object न मिलना: 9.3%
- manipulation module को कठिन pose मिलना: 8.0%
- hardware difficulties: 7.5%
- VLM जैसे open knowledge systems को robot modules के साथ जोड़ते समय सिर्फ model performance ही नहीं, बल्कि object memory, manipulation pose और hardware stability का भी साथ में तालमेल होना ज़रूरी है
3 टिप्पणियां
https://hello-robot.com/purchase
मुख्य यूनिट $25,000 की है...
अतिरिक्त रूप से iPhone Pro भी चाहिए
डॉकिंग चार्जर $995 का है, हाहाहा
क्या यह लोगों को बेवकूफ बनाने वाली कीमत है?
Docking station की कीमत सच में ऐसी क्यों है?
कनेक्शन का तरीका भी DC connector को सीधे लगाना है.. lol
https://hello-robot.com/stretch-docking-station
Hacker News की राय
मुझे लगता है कि ऐसे रोबोट का बाजार तब तक छोटा रहेगा, जब तक वे बाधाओं को संभालना नहीं सीख जाते
बिल्ली ने फर्श के बीचोंबीच खिलौना छोड़ दिया, खुली खिड़की की वजह से टेबल से कागज उड़ गया, बच्चों ने खिलौने बिखेर दिए, आपके न होने पर डेस्क से पेंसिल लुढ़ककर गिर गई, फर्श पर रखे कपड़े, कार्पेट और लकड़ी के फर्श के बीच ऊंचाई का फर्क, खुले या बंद दरवाजे—ये सब समस्याएं हैं
मुख्य काम से पहले खिलौने हटाना, कागज उठाना, कपड़े उठाना, दरवाजा खोलना जैसे कई बीच के काम आ सकते हैं
केबल, ऐसी चीजों के ढेर जिन्हें हिलाना नहीं चाहिए, फर्नीचर, सोते हुए पालतू जानवर, डिलीवरी बॉक्स के ढेर जैसी चीजें पहियों वाले रोबोट को लगभग स्थायी रूप से रोक सकती हैं
इसलिए मुझे लगता है कि general-purpose घरेलू रोबोट में पहिए नहीं, बल्कि टांगे होनी चाहिए, और स्थिरता के लिए शायद दो से ज्यादा भी
सुनने में अजीब लग सकता है, लेकिन आदर्श डिजाइन शायद एक बड़े, दोस्ताना मकड़ी और कुत्ते के बीच जैसा कुछ हो
अजीब है कि robotics आम तौर पर दुनिया को 2D समतल मानने की सोच में फंसी हुई लगती है, और 3D दुनिया में mobility से जुड़ी असली कठिन समस्या को idealize करके हटा देती है
यह रोबोट जो भी करता है, वह भी सिर्फ सपाट horizontal सतहों पर होता है, और काम करने के लिए ऐसा लगता है कि इंसान ने पहले कमरे में घूमकर सब साफ-सुथरा कर दिया है
Roomba में भी यही समस्या है
फर्श पर लंबी केबल न फैलाएं, फर्नीचर पर marking tape लगा सकते हैं, और रोबोट चीजें उठाकर हटा सकता है ताकि वे ठोकर खाने का खतरा न बनी रहें
हम चीजों को ऐसे items से भी बदल सकते हैं जो इंसानों और रोबोट दोनों के लिए friendly हों, जैसे ऐसे बर्तन जिन्हें dishwasher आसानी से पकड़, ले जा और धो सके
हम पहले से microwave-safe या dishwasher-safe products खरीदकर ऐसा ही करते हैं, और अगर कोई चीज ऐसी न हो तो हमें हैरानी होती है
हम पालतू जानवरों के खुद इस्तेमाल के लिए इंसानों वाले दरवाजे में pet door लगाने का खर्च भी उठाते हैं
इंसान बहुत adaptable species है
दूसरी बात, मुझे रोबोट को ceiling rails के नीचे लटकाने का idea हमेशा पसंद रहा है
शानदार फिल्म Moon में भी यह देखा जा सकता है; इसका फायदा यह है कि वह फर्नीचर के ऊपर तैर सकता है, इसलिए उसकी mobility इंसानों से बेहतर होती है
बस इतना चाहिए कि arm रोबोट के सामने फर्श पर पड़ी चीज उठा सके
यह असंभव नहीं लगता, और यह demo चौंकाने वाला है कि कई models को जोड़कर “Takis को bedroom nightstand पर ले जाओ” कहने पर वह कर सकता है
अब बस arm को इतना articulated बनाने की “छोटी” robotics समस्या बचती है कि वह फर्श तक पहुंच सके
वहां इसे cord pusher से हल करते हैं
यह फर्श पर पड़ी चीजों को धकेलने वाला, एक तरह का livestock guard जैसा grid होता है
हर समस्या के लिए जटिल समाधान जरूरी नहीं होता
मुझे लगता है इस project की खूबी खासकर robot design की simplicity में है
बहुत शानदार
मेरा robotics experience बहुत कम है, इसलिए यह बेवकूफी भरा सवाल हो सकता है, लेकिन उत्सुकता है
यह कैसे जानता है कि object क्या है? क्या यह real-time object classification neural network जैसी चीज इस्तेमाल करता है, और इसकी limits क्या हैं?
क्या robot जानता है कि वह request पूरी नहीं कर सकता? उदाहरण के लिए अगर आप उससे बड़ा box या बहुत भारी kettlebell ले जाने को कहें?
अगर object छिपा हो या ढका हुआ हो तो यह कितना अच्छी तरह काम करता है? क्या यह उसे खोजने जाता है? अगर मांगे गए object तक पहुंचने के लिए दूसरे objects हटाने पड़ें तो क्या होता है?
यह work सच में बहुत cool है, लेकिन modern robot learning systems की कई limitations को भी सीधे दिखाता है
यहां(https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...) समझाया गया है; मेरी समझ के मुताबिक, मूल रूप से यह ViT model, यानी image classification model से images को label करता है और फिर उन्हें voxel grid पर project करता है
फिर CLIP के language embeddings से language और voxel grid को जोड़ता है
limitation यह है कि इसे robot पर चलाने के लिए ऐसे models के बेहद बड़े versions इस्तेमाल नहीं कर सकते
cloud में बड़ा model इस्तेमाल कर सकते हैं, लेकिन latency बहुत बढ़ जाती है
अगर request language embedding में cover नहीं होती, तो robot शायद कुछ भी न करे
लेकिन hardware limits of physical controller को छोड़कर, इस system में physics की कोई knowledge नहीं दिखती
voxel labeling उस module पर निर्भर करता है जो voxel को label करता है, और visual information न हो तो label नहीं लगा सकता
साथ ही ऐसा complex high-level reasoning नहीं दिखता कि fork drawer में है, drawer kitchen में है, और kitchen आम तौर पर घर के पीछे होता है
अगर object partially occluded हो तो यह visual classifier की limits पर निर्भर है, इसलिए हो भी सकता है
ViT बहुत अच्छा है, लेकिन यह इस बात पर निर्भर करेगा कि object कितना occluded है
object recognition ज्यादातर Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything) इस्तेमाल करता है, और images व text को जोड़ने का heavy work CLIP embeddings(https://openai.com/research/clip) करते हैं
CLIP जैसी models का एक फायदा यह है कि बाद में query किए जा सकने वाले classes पहले से तय करने की जरूरत नहीं होती; runtime पर जो expression मन में आए, वही इस्तेमाल कर सकते हैं
फिलहाल robot ऐसी requests को नहीं समझता जिन्हें वह perform नहीं कर सकता
अभी model बहुत simple है और कोई खास smart processing करने की कोशिश नहीं करता
इसी वजह से हमने code open किया है, और उम्मीद है कि community इस project के ऊपर environment के visual cues का और ज्यादा इस्तेमाल करने वाले smarter robots बना सकेगी
initial scan में अगर object hidden या occluded हो तो fail हो जाता है
फिर भी मुझे लगता है कि यह आगे की research के लिए अच्छा starting point हो सकता है
एक फायदा यह है कि यह पूरी 3D information को consider करता है, इसलिए अगर कोई object सिर्फ कुछ angles से दिखता है, तो robot के उसे खोज लेने की संभावना है
विकलांग लोगों, बुज़ुर्गों, गेमर्स, बेहद आलसी लोगों और उनकी देखभाल करने वालों के लिए यह ज़िंदगी बदल सकने वाली तकनीक लगती है
जैसे फुटपाथों को wheelchair-friendly बनाने से stroller धकेलने वाले माता-पिता, भारी सामान उठाए लोग, छड़ी का सहारा लेने वाले लोग, साइकिल चलाते छोटे बच्चे और कमज़ोर नज़र वाले लोगों को भी मदद मिलती है
निजी तौर पर मुझे उम्मीद है कि AI को उन नौकरियों के बजाय, जिन्हें हर कोई चाहता है, वे काम करना सिखाया जा सकेगा जिन्हें कोई नहीं करना चाहता
शानदार
अगर इसे कपड़े तह करके सही जगह रखने के लिए train किया जा सके, तो मैं 25,000 डॉलर का robot भी गंभीरता से खरीदने को तैयार हूँ
गुम हुई चीज़ें ढूँढने जैसे लंबे tasks हल करने के लिए, annotated scene को templated description में बदलकर interactive fiction पर trained किसी काफ़ी बड़े model में डाला जा सकता है
“आप kitchen में खड़े हैं। सामने दाईं ओर एक बड़ा refrigerator है, जिसका handle दाईं तरफ है। बाईं ओर cabinets हैं और उनके ऊपर countertop पर plates रखी हैं।”
> get beer“यहाँ beer दिखाई नहीं दे रही है।”
<< COT: मुझे पता है कि beer अक्सर refrigerator में होती है। refrigerator खोलकर देखना चाहिए> open fridge“refrigerator खोलते ही beer के 4 cans दिखाई देते हैं।”
> get beer“ले लिया”
ज़ाहिर है, इसे असल में काम करने में अभी कुछ साल बाकी हैं, लेकिन सोचने पर यह बेहद दिलचस्प है
यह असली sensors द्वारा दी गई interactive fiction narrative और inner monologue के रूप में chain-of-thought blocks को जोड़ने का तरीका है
kitchen की photo खींचकर ChatGPT से पूछ सकते हैं कि beer कहाँ मिलेगी
असल में मैं इसे काफ़ी बार इसी तरह इस्तेमाल करता हूँ
आलस की वजह से parts और boards की photo खींचकर पूछता हूँ कि ESP32 से wiring कैसे करनी है, और यह सिर्फ़ कुछ photos से board, chips और pin layout पहचान लेता है, कौन-सा wire कहाँ जोड़ना है और किन बातों का ध्यान रखना है, यह तक बता देता है
कई बार parts के लिए useful libraries भी suggest कर देता है, और सच में यह लगभग जादू जैसा लगता है
failure analysis सच में बहुत अच्छी तरह किया गया है
hardware failure से उनका क्या मतलब है, यह जानने की उत्सुकता है
उदाहरण के लिए “Realsense ने गलत depth दी” वाले 5 attempts हैं; उन्होंने यह कैसे तय किया, यह जानना चाहूँगा
जिन 5 attempts का आपने ज़िक्र किया, उनमें Realsense ने transparent या translucent objects पर गलत depth values दीं, इसलिए robot head camera से बना point cloud ही गलत था
open source होने के बावजूद इसकी कीमत लगभग 25,000 डॉलर है
सोच रहा हूँ यह इतना महँगा क्यों है
ज़्यादातर mobile manipulation robots की कीमत five figures या उससे ज़्यादा होती है, मुख्यतः क्योंकि market छोटा है, bill of materials और engineering costs ऊँची हैं, और robot बनाना अपने-आप में सिरदर्द है
मेहनत free नहीं होती
custom PCB और hardware को कम मात्रा में बनाना भी सस्ता नहीं है, और robots को बनाना, calibrate करना और test करना भी सस्ता नहीं है
जानना चाहूँगा कि product page का link है या नहीं
hardware proprietary है और patents से protected है
क्या यह Dobb-E जैसा ही नहीं है?
https://dobb-e.com/
हालांकि team में कुछ लोग समान हैं
उदाहरण के लिए, मैं Dobb-E का first author हूँ, और मेरे advisor दोनों projects को advise कर रहे हैं
मुख्य फर्क यह है कि यह project zero-shot है, इसलिए नए घर में 0 नए data की जरूरत होती है, लेकिन skills सिर्फ़ दो हैं: pick और place
वहीं Dobb-E में कई skills हो सकते हैं, लेकिन नए घर में कुछ demonstrations देनी पड़ती हैं
दोनों का इस्तेमाल किए गए robot की website पर ज़िक्र है: https://hello-robot.com/stretch-embodied-ai
मैं कुछ समय से इस project को follow कर रहा हूँ और progress शानदार है
सीमित हाथ-पैर control वाले लोगों के लिए इसे wheelchair जैसे mobility aids के साथ integrate होते हुए imagine कर सकता हूँ
अगर यह असंभव रहे tasks में मदद करने वाला कोई “smart” exoskeleton जैसा बन जाए, तो बहुत से लोगों के लिए game-changer हो सकता है
मुझे सच में एक stabilized platform vehicle चाहिए, जिस पर सामान रखकर point-to-point भेजा जा सके
Segway जैसे gyro-stabilized platform को point A से point B तक, बहुत खराब नहीं लेकिन uneven walking trail जैसे रास्ते पर, आगे-पीछे भेज पाना अच्छा होगा
पहले मैं options देखते रहने की कोशिश करता था, लेकिन इस use case के लिए कुछ नहीं देखा
जानना चाहूँगा कि क्या किसी को इस use case के लिए कोई नया product पता है
खास तौर पर, drinks और hors d'oeuvres वाली tray को property के एक हिस्से से दूसरे हिस्से तक बिना छलकाए ले जाना है, और कम से कम थोड़ी all-terrain capability चाहिए
drinks ले जाते देखा है या नहीं, पता नहीं, लेकिन food तो यह निश्चित रूप से ले जाता है
technology पहले से मौजूद है, बस सब कुछ सही तरह जोड़ना है
gravity हमेशा glass के base की दिशा बनाए रखती है, इसलिए electronic stabilization की जरूरत नहीं