2 पॉइंट द्वारा GN⁺ 2024-02-24 | 3 टिप्पणियां | WhatsApp पर शेयर करें
  • OK-Robot एक खुला मॉड्यूलर रोबोट framework है, जिसका लक्ष्य नए घरेलू वातावरणों में सिर्फ भाषा निर्देशों से वस्तुओं को खोजकर उठाने और ले जाने वाले pick-and-drop कार्यों को zero-shot तरीके से करना है
  • यह vision-language model (VLM), navigation primitives और grasping primitives को जोड़कर अलग training के बिना object recognition, movement और manipulation को एक साथ पिरोता है
  • New York City के 10 असली घरों में 171 tasks का मूल्यांकन किया गया, और पूरी तरह नए घरों में 58.5% success rate दर्ज हुआ
  • साफ और कम बिखरे हुए वातावरणों में success rate बढ़कर 82% हो गया, और Open Vocabulary Mobile Manipulation (OVMM) में पिछले काम की तुलना में लगभग 1.8 गुना performance दिखी
  • मुख्य failures object search, कठिन manipulation poses और hardware issues से आए, जिससे पता चलता है कि open knowledge models और robot modules का बारीक integration performance तय करता है

Framework की संरचना और लक्ष्य

  • OK-Robot किसी भी घर में zero-shot, language-conditioned pick-and-drop tasks करने के लिए एक खुला मॉड्यूलर framework है
  • System तीन components को जोड़ता है
    • Vision-language model (VLM): भाषा query आधारित object detection
    • Navigation primitives: mobile system movement control
    • Grasping primitives: विभिन्न objects का manipulation
  • अलग training stage के बिना object recognition, movement और grasping को integrate करके वास्तविक घरेलू tasks करने वाला system-first approach इस्तेमाल किया गया है
  • Project materials:

असली घरों में evaluation और failure factors

  • New York City के 10 घरेलू वातावरणों में 171 pick-and-drop tasks आज़माए गए
  • पूरी तरह नए घरों में success rate 58.5% था, और Open Vocabulary Mobile Manipulation (OVMM) में पिछले काम की तुलना में लगभग 1.8 गुना performance दिखी
    • Success rate: {p:58}
  • ज़्यादा साफ और कम बिखरे हुए वातावरणों में success rate बढ़कर 82% हो गया
    • व्यवस्थित वातावरण में success rate: {p:82}
  • Failure causes long-tail distribution में फैले हुए हैं, और तीन सबसे बड़े कारण ये हैं
    • semantic memory में ले जाने के लिए सही object न मिलना: 9.3%
    • manipulation module को कठिन pose मिलना: 8.0%
    • hardware difficulties: 7.5%
  • VLM जैसे open knowledge systems को robot modules के साथ जोड़ते समय सिर्फ model performance ही नहीं, बल्कि object memory, manipulation pose और hardware stability का भी साथ में तालमेल होना ज़रूरी है

3 टिप्पणियां

 
yeorinhieut 2024-02-24

https://hello-robot.com/purchase

मुख्य यूनिट $25,000 की है...
अतिरिक्त रूप से iPhone Pro भी चाहिए
डॉकिंग चार्जर $995 का है, हाहाहा

क्या यह लोगों को बेवकूफ बनाने वाली कीमत है?

 
yeorinhieut 2024-02-24

Docking station की कीमत सच में ऐसी क्यों है?
कनेक्शन का तरीका भी DC connector को सीधे लगाना है.. lol

https://hello-robot.com/stretch-docking-station

 
GN⁺ 2024-02-24
Hacker News की राय
  • मुझे लगता है कि ऐसे रोबोट का बाजार तब तक छोटा रहेगा, जब तक वे बाधाओं को संभालना नहीं सीख जाते
    बिल्ली ने फर्श के बीचोंबीच खिलौना छोड़ दिया, खुली खिड़की की वजह से टेबल से कागज उड़ गया, बच्चों ने खिलौने बिखेर दिए, आपके न होने पर डेस्क से पेंसिल लुढ़ककर गिर गई, फर्श पर रखे कपड़े, कार्पेट और लकड़ी के फर्श के बीच ऊंचाई का फर्क, खुले या बंद दरवाजे—ये सब समस्याएं हैं
    मुख्य काम से पहले खिलौने हटाना, कागज उठाना, कपड़े उठाना, दरवाजा खोलना जैसे कई बीच के काम आ सकते हैं
    केबल, ऐसी चीजों के ढेर जिन्हें हिलाना नहीं चाहिए, फर्नीचर, सोते हुए पालतू जानवर, डिलीवरी बॉक्स के ढेर जैसी चीजें पहियों वाले रोबोट को लगभग स्थायी रूप से रोक सकती हैं
    इसलिए मुझे लगता है कि general-purpose घरेलू रोबोट में पहिए नहीं, बल्कि टांगे होनी चाहिए, और स्थिरता के लिए शायद दो से ज्यादा भी
    सुनने में अजीब लग सकता है, लेकिन आदर्श डिजाइन शायद एक बड़े, दोस्ताना मकड़ी और कुत्ते के बीच जैसा कुछ हो
    अजीब है कि robotics आम तौर पर दुनिया को 2D समतल मानने की सोच में फंसी हुई लगती है, और 3D दुनिया में mobility से जुड़ी असली कठिन समस्या को idealize करके हटा देती है
    यह रोबोट जो भी करता है, वह भी सिर्फ सपाट horizontal सतहों पर होता है, और काम करने के लिए ऐसा लगता है कि इंसान ने पहले कमरे में घूमकर सब साफ-सुथरा कर दिया है
    Roomba में भी यही समस्या है

    • मुझे लगता है बहुत से लोग सुविधा के लिए जरूरी समझौते स्वीकार कर लेंगे
      फर्श पर लंबी केबल न फैलाएं, फर्नीचर पर marking tape लगा सकते हैं, और रोबोट चीजें उठाकर हटा सकता है ताकि वे ठोकर खाने का खतरा न बनी रहें
      हम चीजों को ऐसे items से भी बदल सकते हैं जो इंसानों और रोबोट दोनों के लिए friendly हों, जैसे ऐसे बर्तन जिन्हें dishwasher आसानी से पकड़, ले जा और धो सके
      हम पहले से microwave-safe या dishwasher-safe products खरीदकर ऐसा ही करते हैं, और अगर कोई चीज ऐसी न हो तो हमें हैरानी होती है
      हम पालतू जानवरों के खुद इस्तेमाल के लिए इंसानों वाले दरवाजे में pet door लगाने का खर्च भी उठाते हैं
      इंसान बहुत adaptable species है
      दूसरी बात, मुझे रोबोट को ceiling rails के नीचे लटकाने का idea हमेशा पसंद रहा है
      शानदार फिल्म Moon में भी यह देखा जा सकता है; इसका फायदा यह है कि वह फर्नीचर के ऊपर तैर सकता है, इसलिए उसकी mobility इंसानों से बेहतर होती है
    • यह general-purpose concept की आलोचना नहीं, बल्कि किसी specific platform की limitation पर critique जैसा है
      बस इतना चाहिए कि arm रोबोट के सामने फर्श पर पड़ी चीज उठा सके
      यह असंभव नहीं लगता, और यह demo चौंकाने वाला है कि कई models को जोड़कर “Takis को bedroom nightstand पर ले जाओ” कहने पर वह कर सकता है
      अब बस arm को इतना articulated बनाने की “छोटी” robotics समस्या बचती है कि वह फर्श तक पहुंच सके
    • पहियों वाला equipment हो तो hospital environment में भी यही समस्या होती है
      वहां इसे cord pusher से हल करते हैं
      यह फर्श पर पड़ी चीजों को धकेलने वाला, एक तरह का livestock guard जैसा grid होता है
      हर समस्या के लिए जटिल समाधान जरूरी नहीं होता
      मुझे लगता है इस project की खूबी खासकर robot design की simplicity में है
  • बहुत शानदार
    मेरा robotics experience बहुत कम है, इसलिए यह बेवकूफी भरा सवाल हो सकता है, लेकिन उत्सुकता है
    यह कैसे जानता है कि object क्या है? क्या यह real-time object classification neural network जैसी चीज इस्तेमाल करता है, और इसकी limits क्या हैं?
    क्या robot जानता है कि वह request पूरी नहीं कर सकता? उदाहरण के लिए अगर आप उससे बड़ा box या बहुत भारी kettlebell ले जाने को कहें?
    अगर object छिपा हो या ढका हुआ हो तो यह कितना अच्छी तरह काम करता है? क्या यह उसे खोजने जाता है? अगर मांगे गए object तक पहुंचने के लिए दूसरे objects हटाने पड़ें तो क्या होता है?

    • इस field में काम करता हूं, लेकिन authors में से एक नहीं हूं—इस आधार पर कहूं तो सवालों ने बिल्कुल core बात पकड़ी है
      यह work सच में बहुत cool है, लेकिन modern robot learning systems की कई limitations को भी सीधे दिखाता है
      1. यह object classifier इस्तेमाल करता है
        यहां(https://github.com/ok-robot/ok-robot/tree/main/ok-robot-navi...) समझाया गया है; मेरी समझ के मुताबिक, मूल रूप से यह ViT model, यानी image classification model से images को label करता है और फिर उन्हें voxel grid पर project करता है
        फिर CLIP के language embeddings से language और voxel grid को जोड़ता है
        limitation यह है कि इसे robot पर चलाने के लिए ऐसे models के बेहद बड़े versions इस्तेमाल नहीं कर सकते
        cloud में बड़ा model इस्तेमाल कर सकते हैं, लेकिन latency बहुत बढ़ जाती है
      2. यह invalid requests को शायद ही पहचान पाएगा
        अगर request language embedding में cover नहीं होती, तो robot शायद कुछ भी न करे
        लेकिन hardware limits of physical controller को छोड़कर, इस system में physics की कोई knowledge नहीं दिखती
      3. Hidden objects लगभग निश्चित रूप से नहीं होंगे
        voxel labeling उस module पर निर्भर करता है जो voxel को label करता है, और visual information न हो तो label नहीं लगा सकता
        साथ ही ऐसा complex high-level reasoning नहीं दिखता कि fork drawer में है, drawer kitchen में है, और kitchen आम तौर पर घर के पीछे होता है
        अगर object partially occluded हो तो यह visual classifier की limits पर निर्भर है, इसलिए हो भी सकता है
        ViT बहुत अच्छा है, लेकिन यह इस बात पर निर्भर करेगा कि object कितना occluded है
    • project/paper author के तौर पर confirm करूं तो, नीचे fishbotics ने पहले ही कई सवालों के जवाब दे दिए हैं, लेकिन मैं कुछ और जोड़ सकता हूं
      object recognition ज्यादातर Lang-SAM(https://github.com/luca-medeiros/lang-segment-anything) इस्तेमाल करता है, और images व text को जोड़ने का heavy work CLIP embeddings(https://openai.com/research/clip) करते हैं
      CLIP जैसी models का एक फायदा यह है कि बाद में query किए जा सकने वाले classes पहले से तय करने की जरूरत नहीं होती; runtime पर जो expression मन में आए, वही इस्तेमाल कर सकते हैं
      फिलहाल robot ऐसी requests को नहीं समझता जिन्हें वह perform नहीं कर सकता
      अभी model बहुत simple है और कोई खास smart processing करने की कोशिश नहीं करता
      इसी वजह से हमने code open किया है, और उम्मीद है कि community इस project के ऊपर environment के visual cues का और ज्यादा इस्तेमाल करने वाले smarter robots बना सकेगी
      initial scan में अगर object hidden या occluded हो तो fail हो जाता है
      फिर भी मुझे लगता है कि यह आगे की research के लिए अच्छा starting point हो सकता है
      एक फायदा यह है कि यह पूरी 3D information को consider करता है, इसलिए अगर कोई object सिर्फ कुछ angles से दिखता है, तो robot के उसे खोज लेने की संभावना है
  • विकलांग लोगों, बुज़ुर्गों, गेमर्स, बेहद आलसी लोगों और उनकी देखभाल करने वालों के लिए यह ज़िंदगी बदल सकने वाली तकनीक लगती है

    • याद नहीं कहाँ देखा था, लेकिन आम तौर पर विकलांग लोगों के लिए किया गया सुधार सभी के लिए अच्छा हो जाता है
      जैसे फुटपाथों को wheelchair-friendly बनाने से stroller धकेलने वाले माता-पिता, भारी सामान उठाए लोग, छड़ी का सहारा लेने वाले लोग, साइकिल चलाते छोटे बच्चे और कमज़ोर नज़र वाले लोगों को भी मदद मिलती है
    • इस home robot काम की बड़ी प्रेरणाओं में से एक बुज़ुर्गों, विकलांग लोगों, या उन busy parents के बारे में सोचना है जिनके पास सारे काम निपटाने का समय नहीं होता
      निजी तौर पर मुझे उम्मीद है कि AI को उन नौकरियों के बजाय, जिन्हें हर कोई चाहता है, वे काम करना सिखाया जा सकेगा जिन्हें कोई नहीं करना चाहता
  • शानदार
    अगर इसे कपड़े तह करके सही जगह रखने के लिए train किया जा सके, तो मैं 25,000 डॉलर का robot भी गंभीरता से खरीदने को तैयार हूँ

    • अगर यह laundry, बर्तन धोना, खाना बनाना और बच्चों का फैलाया सामान समेटना कर सके, तो मैं 100,000 डॉलर का robot भी तुरंत खरीद लूँगा
    • तह करने के काम के लिए शायद इस robot के अलावा दूसरा robot खरीदना पड़े: https://pantor.github.io/speedfolding/
  • गुम हुई चीज़ें ढूँढने जैसे लंबे tasks हल करने के लिए, annotated scene को templated description में बदलकर interactive fiction पर trained किसी काफ़ी बड़े model में डाला जा सकता है
    “आप kitchen में खड़े हैं। सामने दाईं ओर एक बड़ा refrigerator है, जिसका handle दाईं तरफ है। बाईं ओर cabinets हैं और उनके ऊपर countertop पर plates रखी हैं।”
    > get beer
    “यहाँ beer दिखाई नहीं दे रही है।”
    << COT: मुझे पता है कि beer अक्सर refrigerator में होती है। refrigerator खोलकर देखना चाहिए
    > open fridge
    “refrigerator खोलते ही beer के 4 cans दिखाई देते हैं।”
    > get beer
    “ले लिया”
    ज़ाहिर है, इसे असल में काम करने में अभी कुछ साल बाकी हैं, लेकिन सोचने पर यह बेहद दिलचस्प है
    यह असली sensors द्वारा दी गई interactive fiction narrative और inner monologue के रूप में chain-of-thought blocks को जोड़ने का तरीका है

    • अब शायद हम robot को कमरे में घूमते हुए “चाबियाँ, चाबियाँ, चाबियाँ... मैंने चाबियाँ कहाँ रखीं?” बुदबुदाना सिखा सकते हैं
    • multimodal LLM इस तरह के काम पहले से ही बहुत अच्छी तरह करते हैं
      kitchen की photo खींचकर ChatGPT से पूछ सकते हैं कि beer कहाँ मिलेगी
      असल में मैं इसे काफ़ी बार इसी तरह इस्तेमाल करता हूँ
      आलस की वजह से parts और boards की photo खींचकर पूछता हूँ कि ESP32 से wiring कैसे करनी है, और यह सिर्फ़ कुछ photos से board, chips और pin layout पहचान लेता है, कौन-सा wire कहाँ जोड़ना है और किन बातों का ध्यान रखना है, यह तक बता देता है
      कई बार parts के लिए useful libraries भी suggest कर देता है, और सच में यह लगभग जादू जैसा लगता है
  • failure analysis सच में बहुत अच्छी तरह किया गया है
    hardware failure से उनका क्या मतलब है, यह जानने की उत्सुकता है
    उदाहरण के लिए “Realsense ने गलत depth दी” वाले 5 attempts हैं; उन्होंने यह कैसे तय किया, यह जानना चाहूँगा

    • सारा data collect करने के बाद post-hoc analysis में failure का कारण देखा गया
      जिन 5 attempts का आपने ज़िक्र किया, उनमें Realsense ने transparent या translucent objects पर गलत depth values दीं, इसलिए robot head camera से बना point cloud ही गलत था
  • open source होने के बावजूद इसकी कीमत लगभग 25,000 डॉलर है
    सोच रहा हूँ यह इतना महँगा क्यों है

    • क्योंकि यह low-volume product है, जिसके बनाने और maintain करने वाले engineers की salaries भी निकालनी पड़ती हैं
    • robot standards से देखें तो 25,000 डॉलर बुरा नहीं है
      ज़्यादातर mobile manipulation robots की कीमत five figures या उससे ज़्यादा होती है, मुख्यतः क्योंकि market छोटा है, bill of materials और engineering costs ऊँची हैं, और robot बनाना अपने-आप में सिरदर्द है
    • कब से open source का मतलब सस्ता हो गया?
      मेहनत free नहीं होती
      custom PCB और hardware को कम मात्रा में बनाना भी सस्ता नहीं है, और robots को बनाना, calibrate करना और test करना भी सस्ता नहीं है
    • कीमत कहाँ दी है?
      जानना चाहूँगा कि product page का link है या नहीं
    • software open source है
      hardware proprietary है और patents से protected है
  • क्या यह Dobb-E जैसा ही नहीं है?
    https://dobb-e.com/

    • नहीं
      हालांकि team में कुछ लोग समान हैं
      उदाहरण के लिए, मैं Dobb-E का first author हूँ, और मेरे advisor दोनों projects को advise कर रहे हैं
      मुख्य फर्क यह है कि यह project zero-shot है, इसलिए नए घर में 0 नए data की जरूरत होती है, लेकिन skills सिर्फ़ दो हैं: pick और place
      वहीं Dobb-E में कई skills हो सकते हैं, लेकिन नए घर में कुछ demonstrations देनी पड़ती हैं
    • दोनों projects related लगते हैं और common authors भी हैं
      दोनों का इस्तेमाल किए गए robot की website पर ज़िक्र है: https://hello-robot.com/stretch-embodied-ai
  • मैं कुछ समय से इस project को follow कर रहा हूँ और progress शानदार है
    सीमित हाथ-पैर control वाले लोगों के लिए इसे wheelchair जैसे mobility aids के साथ integrate होते हुए imagine कर सकता हूँ
    अगर यह असंभव रहे tasks में मदद करने वाला कोई “smart” exoskeleton जैसा बन जाए, तो बहुत से लोगों के लिए game-changer हो सकता है

  • मुझे सच में एक stabilized platform vehicle चाहिए, जिस पर सामान रखकर point-to-point भेजा जा सके
    Segway जैसे gyro-stabilized platform को point A से point B तक, बहुत खराब नहीं लेकिन uneven walking trail जैसे रास्ते पर, आगे-पीछे भेज पाना अच्छा होगा
    पहले मैं options देखते रहने की कोशिश करता था, लेकिन इस use case के लिए कुछ नहीं देखा
    जानना चाहूँगा कि क्या किसी को इस use case के लिए कोई नया product पता है
    खास तौर पर, drinks और hors d'oeuvres वाली tray को property के एक हिस्से से दूसरे हिस्से तक बिना छलकाए ले जाना है, और कम से कम थोड़ी all-terrain capability चाहिए

    • restaurants में आपने शायद ऐसा कुछ पहले ही देखा हो: https://www.pudurobotics.com/product/detail/bellabot
      drinks ले जाते देखा है या नहीं, पता नहीं, लेकिन food तो यह निश्चित रूप से ले जाता है
    • https://www.youtube.com/watch?v=VGzRfvgnS_s
      technology पहले से मौजूद है, बस सब कुछ सही तरह जोड़ना है
    • drinks को रस्सी से लटकी plate पर रखकर ले जाइए
      gravity हमेशा glass के base की दिशा बनाए रखती है, इसलिए electronic stabilization की जरूरत नहीं