1 पॉइंट द्वारा GN⁺ 2 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Google DeepMind ने Gemini Robotics 2 मॉडल फैमिली पेश की है, जो visual और language input को actions में बदलकर humanoid के पैरों से लेकर उंगलियों तक नियंत्रण करती है, और सटीक manipulation तथा robots के बीच collaboration को support करती है
  • इस मॉडल फैमिली में whole-body control के लिए VLA Gemini Robotics 2, लंबे कार्यों की planning और supervision के लिए Gemini Robotics ER 2, और robot पर local रूप से चलने वाला Gemini Robotics On-Device 2 शामिल हैं
  • Humanoid चलना, झुकना और वस्तुएं ले जाना एक साथ कर सकते हैं, और 22 degrees of freedom वाली 5-उंगली hand से knot बांध सकते हैं या zipper bag seal कर सकते हैं; कई robots ऐसे कामों में मिलकर काम कर सकते हैं जिन्हें अकेला robot संभालना मुश्किल हो
  • On-Device 2 बिना network connection के चलता है, और आम तौर पर 200 से कम examples तथा कुछ घंटों की adaptation process के साथ इसे ऐसे नए dual-arm robots पर लागू किया जा सकता है जिनकी form, sensors और degrees of freedom काफी अलग हों
  • ER 2, Google AI Studio और Gemini Enterprise Agent Platform पर private preview में उपलब्ध है, और VLA व On-Device models early access partners के लिए खुले हैं, लेकिन movement speed और precision में अभी भी सुधार की जरूरत है

अलग-अलग भूमिकाओं वाले तीन robot models

  • मौजूदा robots आम तौर पर पहले से programmed या remotely operated, संकीर्ण और दोहराए जाने वाले task sequences पर निर्भर रहे हैं, इसलिए उनके लिए अप्रत्याशित environment में खुद adapt करना या एक robot की skill को दूसरे form factor में transfer करना मुश्किल होता है
  • Gemini Robotics 2 visual और language input को motor control में बदलने वाला vision-language-action model (VLA) है
    • यह पूरे humanoid और dual-arm robots को control करता है
    • यह दोनों hands और grippers के जरिए सटीक manipulation को support करता है
  • Gemini Robotics ER 2 robot के agent की भूमिका निभाने वाला embodied reasoning (ER) model है
    • यह लोगों से communicate करता है और physical environment को समझता है
    • यह कई मिनट तक चलने वाले multi-step tasks की planning करता है
    • यह कई robots की team-based work को support करता है
  • Gemini Robotics On-Device 2 एक efficient VLA है जिसे robot device पर local रूप से चलाने के लिए optimize किया गया है
    • यह कुछ घंटों के data से पूरी तरह नए robot forms के अनुकूल हो सकता है
  • हर model की availability अलग है

ऊपरी धड़ से आगे, humanoid का पूरे शरीर का नियंत्रण

  • अगर पिछला model tabletop tasks के लिए humanoid upper body control पर केंद्रित था, तो Gemini Robotics 2 ने नियंत्रण का दायरा बढ़ाकर whole-body motion तक पहुंचा दिया है
  • Apptronik Apollo 2 “watering can को नीचे वाली shelf के हरे box में रखो” जैसे निर्देश को संभाल सकता है
    • यह table तक चलकर watering can उठाता है
    • फिर shelf तक जाकर उसे तय जगह पर सही तरीके से रख देता है
  • यह चलना, झुकना, balance बनाए रखना और वस्तुओं को manipulate करना जोड़कर तंग और बिखरे हुए spaces में काम करता है, लेकिन movement speed में अभी और सुधार चाहिए

hands और grippers से सटीक manipulation

  • Apollo 2 में लगे SharpaWave hand की पांच उंगलियों और 22 degrees of freedom को control किया जाता है
    • यह knot बांधने जैसी नाजुक movements कर सकता है
    • यह zipper bag seal कर सकता है
  • Franka Duo के standard two-finger parallel gripper के साथ यह घनी packing जैसे जटिल tasks भी संभालता है
  • इंसानी स्तर की dexterity तक पहुंचने के लिए precision और speed को लगातार बढ़ाना होगा

long-horizon task reasoning और multi-robot collaboration

  • Gemini Robotics ER 2 robot के high-level brain की तरह user instructions को process करता है और लोगों से communicate करता है
    • यह space को observe करके जरूरी steps का अनुमान लगाता है
    • यह VLA के साथ coordinate करके actual actions करवाता है
    • यह task पूरा होने तक progress track करता है
  • जटिल multi-step tasks के दौरान अगर कोई step fail हो जाए तो यह self-correct कर सकता है, और नई situations व goals पर generalize भी कर सकता है
  • यह एक task में सैकड़ों बार decisions लेता है, और कई मिनट तक चलने वाली task sequences को पहले से ज्यादा स्थिरता से संभालता है
  • यह task की शुरुआत और अंत को समझता है, और key events कब हुए इसकी पहचान कर progress state को track करता है
  • अलग-अलग प्रकार के robots एक-दूसरे से communicate और collaborate करके ऐसे जटिल workflows संभाल सकते हैं जिन्हें अकेला robot करना मुश्किल हो

नए robot forms के लिए तेज adaptation

  • Gemini Robotics On-Device 2 उन environments के लिए robot device पर local execution करता है जहां network latency या internet connection के बिना काम करना जरूरी हो
  • यह कई robot forms को base support देता है और Gemini Robotics 1.5 की motion transfer technology को आगे बढ़ाता है
  • आम तौर पर 200 से कम examples और कुछ घंटों की adaptation process के साथ इसे नए dual-arm robots पर लागू किया जा सकता है
  • यह appearance, sensors और degrees of freedom में काफी अलग robots पर भी adapt करता है, और Dexmate, SO101, Trossen platforms पर अलग-अलग tasks करता है

uncertainty तक संभालने वाली robot safety

  • जैसे-जैसे robots की physical capabilities बढ़ती हैं, वैसे-वैसे पारंपरिक physical safety measures और AI safety framework को मिलाकर multi-layered safety approach लागू की जाती है
  • ASIMOV-Agentic agent safety coordination और uncertainty handling का आकलन करने वाला नया benchmark है
    • यह मापता है कि embodied reasoning agent, VLA द्वारा मांगे गए unsafe tool calls को reject कर सकता है या नहीं
    • यह इस बात का आकलन करता है कि क्या system task success की संभावना का अनुमान लगाता है और uncertainty होने पर proactively human intervention मांगता है
  • Gemini Robotics ER 2 ने safety constraints compliance और human proximity benchmarks में Google DeepMind के मौजूदा robot models में सबसे सुरक्षित performance दिखाई है
    • यह आसपास मौजूद लोगों को बेहतर detect करता है
    • जब कोई व्यक्ति बहुत करीब आ जाता है, तो यह safety tools call करता है और robot को सुरक्षित रूप से stop कर देता है
    • यह लोगों के साथ काम करने के लिए collaborative safety standards में जरूरी capability है
  • विस्तृत evaluation Gemini Robotics 2: Safety Technical Report में देखी जा सकती है
  • लक्ष्य केवल single-task automation से आगे बढ़कर, लोगों के साथ मिलकर जटिल समस्याएं हल करने वाली general-purpose physical AI की core intelligence बनाना है

1 टिप्पणियां

 
GN⁺ 2 시간 전
Hacker News की राय
  • इस मॉडल के विकास में शामिल DeepMind researcher के रूप में, DeepMind काम करने के लिए अच्छी जगह है। Gemini·Gemma, robotics, मौसम और biology जैसे science क्षेत्रों सहित intelligence से जुड़े लगभग हर क्षेत्र में आवाजाही कर सकने वाली कुछ गिनी-चुनी अनोखी research labs में से एक है, और यहाँ बेहतरीन सहकर्मी हैं, इसलिए जुड़ने पर विचार किया जा सकता है

    • जानना चाहूँगा कि frontier model development और open model development में ठोस तौर पर क्या फर्क है। open models आम तौर पर छोटे होते हैं और ज्यादा safety checks से गुजरते हैं, लेकिन मूल रूप से समान लगते हैं, और लगता है कि सामान्य AI research का ज्यादातर हिस्सा दोनों पर लागू होता है
    • सच में जानना चाहता हूँ कि सरकारों, कंपनियों और सेना के दुरुपयोग को कैसे रोका जा रहा है। यह भी जानना चाहूँगा कि यह technology आम लोगों की जिंदगी बेहतर करने में कितनी इस्तेमाल होगी, और निगरानी व नियंत्रण बढ़ाने में कितनी
    • “एकमात्र research lab” कहना अतिशयोक्ति है। Allen Institute for AI(AI2) भी frontier स्तर पर उतना नहीं, लेकिन ज्यादातर क्षेत्रों को कवर करता है, और NSF की 152 मिलियन डॉलर funding व Nvidia collaboration से भी उम्मीद है। robotics क्षेत्र में MolmoBot, MolmoSpaces, MolmoAct आदि हैं: https://allenai.org/embodied-ai
    • 2007 से AGI Conference चलाने वाली AGI Society के executive director के रूप में, मैं चाहूँगा कि आप अगले साल के event में अपनी research present करें। इस साल Alexander Lerchner की presentation शानदार थी, और अगर आप अपना preferred email बता दें तो संपर्क करूँगा
  • Anthropic और OpenAI 80% attention ले जाते हैं, लेकिन Google जिस दायरे में frontier-grade, high-speed, open-weight models से लेकर image, video, music generation और robotics तक कर रहा है, वह प्रभावशाली है

    • Google कई नई technologies के अग्रिम मोर्चे पर चुपचाप सक्षम कंपनी की तरह काम करता है, जबकि OpenAI और Anthropic के latest chatbots को “बेकाबू AI”, “इतना खतरनाक कि ban होना चाहिए” जैसी बढ़ा-चढ़ाकर लिखी गई coverage मिलती है। यह hype cycle नई competitors की बेतुकी valuations को सहारा दे रहा है
    • Google DeepMind AI frontier पर नए concepts विकसित कर रहा है, जबकि बाकी जगहें benchmark scores के कुछ percent के पीछे भाग रही हैं
    • protein folding research और Nobel Prize को भी नहीं भूल सकते
  • robot की movements धीमी और smooth नहीं हैं, लेकिन शुरुआती ChatGPT भी बहुत सुस्त दिखता था। अगर यह LLM जितनी तेजी से विकसित हुआ, तो कुछ सालों में इसका उपयोग-क्षेत्र बहुत बड़ा हो सकता है

    • घर के काम इंसान से ज्यादा समय लें तो भी फर्क नहीं पड़ता। ऑफिस से लौटने से पहले सफाई खत्म हो जाए, इतना काफी है
    • GPT-2 से GPT-3 तक और Gemini Robotics 1 से 2 तक दोनों में 15 महीने लगे, लेकिन पहले में जबरदस्त leap था जबकि बाद वाला लगभग वैसा ही रहा: https://blog.google/products-and-platforms/products/gemini/h...
      धीमी और static robot movements और तेज, flexible movements की difficulty बिल्कुल अलग है। तेजी से चलने पर कई joints और masses की rotational inertia, balance changes को प्रति सेकंड सैकड़ों से हजारों बार calculate करना पड़ता है। रुकी हुई स्थिति में T-shirt को 90% probability से fold करना आसान है, लेकिन 99% success rate या fast folding अविश्वसनीय रूप से complex है
    • यह पहला promotional video है जो real-time speed पर भी reasonable लगता है। हालांकि अन्य materials में 50–75% success rate first attempt के लिए है या final success के लिए, यह unclear है
    • Google का Moravec’s paradox को सीधे challenge करना काफी bold है: https://en.wikipedia.org/wiki/Moravec%27s_paradox
    • movements smooth हैं लेकिन धीमी हैं, और शायद safety के कारण। शक्तिशाली motors वाले robots वास्तव में लोगों को चोट पहुँचा सकते हैं, इसलिए industrial robots भी safety fence के भीतर operate करते हैं
      उनसे digital doll की तरह inverse kinematics movements को हूबहू imitate करने की उम्मीद नहीं करनी चाहिए। अगर optimization goal energy consumption कम करना है, तो multi-joint electric arm की movements कुछ अजीब दिख सकती हैं
  • humanoid robots से उम्मीद actuators की limits के कारण छोड़ दी है। Honda ASIMO के बाद innovation बहुत कम हुई, और शायद कोई भी अपने घर या workplace में 80kg का डगमगाता metal का ढेर नहीं रखना चाहेगा
    अंतिम robot revolution दिमाग की जगह बदले हुए genetically modified human/animal bodies का इस्तेमाल कर सकती है। मेरा मानना है कि consciousness न होने के लिए बनाए गए bear को Neuralink और LLM से control किया जाए तो वह construction worker के रूप में ज्यादा suitable होगा; तेज animals delivery में और giraffes warehouses में उपयोगी हो सकते हैं

    • giraffes केवल लंबे होते हैं, ज्यादा वजन उठा नहीं सकते, इसलिए warehouses में उनकी उपयोगिता संदिग्ध है। actuator innovation नहीं हुई, यह दावा भी मानना मुश्किल है, और MIT Cheetah के actuators backdrivability और variable stiffness के मामले में ASIMO से बिल्कुल अलग हैं; elastic elements combine करने पर भी active research हो रही है
    • Cortical Labs इस क्षेत्र पर research करता है और कभी Doom demo भी release किया था। bio-forms में generality है, लेकिन कई tasks के लिए metal forms ज्यादा durable हैं, और brain में bandwidth low और latency high होती है, इसलिए inference के लिए silicon chips बेहतर हैं
      3D printing क्षेत्र में दिलचस्प काम देखकर मुझे लगता था कि actuators भी काफी आगे बढ़ रहे हैं, इसलिए पीछे रह जाने वाले दावे के बारे में और जानना चाहूँगा
    • actuators आगे नहीं बढ़े, इससे बिल्कुल सहमत नहीं हूँ। Ben Katz की MIT Mini Cheetah research के बाद torque density और price में बड़ी improvement हुई है, और उस पर आधारित Unitree G1 actuator छोटा लेकिन powerful है और quasi-direct drive के करीब है। BD E-Atlas motor भी पूरी तरह passive cooling वाली होते हुए अच्छी torque density वाली लगती है, और development इतनी तेजी से पहले कभी नहीं हुई
    • ऐसा future भयानक है, लेकिन technical difficulty और experiment permissions की barriers के कारण बहुत दूर लगता है। हालांकि मैं इससे सहमत हूँ कि humanoid form एक dead end है
      dishwasher की तरह input process कर output देने वाला एक बड़ा box बनाया जा सकता है। इंसानी हाथ की नकल करने के बजाय washing machine और dryer के counterpart के रूप में clothes-folding device या integrated robotic kitchen बनाना कहीं ज्यादा efficient होगा
    • जैविक शरीरों को modify करना humanoid robots बनाने से कई orders of magnitude ज्यादा कठिन लगता है। हम अभी तक गायों के बिना marketable price पर hamburger भी नहीं बना पाए हैं
  • इस तकनीक के वास्तविक स्तर का ईमानदार आकलन करने वाला कोई चाहिए। जरूरी मापन उपकरण, interaction quality, दरवाज़े का हैंडल घुमाने और गिरने के बाद संभलने, collision avoidance जैसे असंरचित रोज़मर्रा के कामों में प्रदर्शन जानना चाहता हूँ

    • मैं इस क्षेत्र में काम करता हूँ और humanoid नहीं बल्कि vision-language-action model (VLA), यानी ChatGPT को robot arm से जोड़ने के विषय पर अपनी undergraduate thesis लिखी थी। यह अभी practical stage में नहीं है, और assembly parts के कभी-कभी सटीक नाम भी नहीं होते, इसलिए इंसान जिस अस्पष्ट निर्देश को समझ लेगा, robot उसे process नहीं कर पाएगा
      भरोसेमंद accuracy data भी कम है, और LIBERO जैसे benchmarks में लगभग सभी 95% score कर रहे हैं, इसलिए वे saturate हो चुके हैं; कंपनियाँ और शोधकर्ता अपनी-अपनी evaluation इस्तेमाल करते हैं। कई कंपनियाँ demo में धोखा देती हैं या इंसानों के पास खतरनाक तरीके से इन्हें चलाती हैं
      दरवाज़े के हैंडल और fall recovery से भी ज़्यादा मुश्किल manufacturing process में bricks या parts को सटीक तरीके से align करना है। इतने सारे joints manage करने वाले जटिल humanoid की तुलना में Mobile ALOHA जैसे पहियों वाले robot arms hotel rooms की सफ़ाई या तयशुदा काम वाले restaurant cooking के लिए ज़्यादा उपयुक्त लगते हैं
    • अभी यह GPT-1 स्तर पर है, लेकिन GPT-2 के बराबर वाला क्षण नज़दीक लगता है
    • असली validation criterion यह है कि home-service robots बेचने वाला कोई startup सच में repeat users हासिल करता है या नहीं। मैंने कई robot prototypes professionally बनाए हैं; प्रगति साफ़ है, लेकिन आम consumer के लिए chores में reliably इस्तेमाल करने से अभी बहुत दूर है
      https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... के तर्क की तरह, dexterity hardware problem भी है, और gripper हाथ नहीं होता। Multi-finger hand manipulation भी अब तक मुश्किल है और sensors भी पर्याप्त नहीं हैं
    • robotics industry में किसी खास demo के लिए बेहद सावधानी से सजाए गए videos, और autonomous operation बताकर असल में remote control से चलाए गए fraud तक, बहुत ज़्यादा दिखावा और धोखा है। Robot dogs या unmanned ground vehicles भी hype के उलट practical नहीं हैं
      robotics, collaborative robots के क्षेत्र को छोड़कर, niche industry है; exception drones हैं, जिनमें सिर्फ़ flight time की समस्या हल हो जाए तो बड़ा potential है। humanoids को real environments में useful बनने में अभी लंबा समय लगेगा, और ज़्यादातर unmanned ground vehicles सीढ़ियों पर पीछे तक नहीं जा सकते
  • AI robotics ही असली revolution है। अभी capital holders को और capital पाने के लिए human labor चाहिए, लेकिन जब robot inference cost wages से कम हो जाएगी, तो human labor की जरूरत नहीं रहेगी। AI non-physical labor को भी प्रभावित करता है, लेकिन दुनिया की बड़ी आबादी physical labor में लगी है

    • अगर inference के अलावा बाकी costs को नज़रअंदाज़ करें और उस final state को मान लें, तो capital democratize हो जाए तो यह बहुत अच्छा होगा, लेकिन अगर यह कुछ ही वर्गों में केंद्रित रहा तो नतीजा लगभग विनाशकारी होगा
    • यह सिर्फ inference cost का मामला नहीं है। real world में objects या living beings को गलत तरीके से handle करने पर नुकसान non-material applications से बिल्कुल अलग होता है, इसलिए fail-safes और independent limiters की जरूरत पड़ सकती है
    • शक है कि वह बदलाव सचमुच अच्छा होगा या नहीं
  • 47 साल का बिना बच्चों वाला पुरुष होने के नाते, बुढ़ापे में care robots की मदद मिलने की संभावना से उम्मीद रखता हूँ

    • यह हैरान करने वाला है कि मेरे जीते-जी Star Wars जैसे droids देखने की संभावना बढ़ गई है, लेकिन सब इसे बहुत मामूली बात की तरह ले रहे हैं
    • 50s में होने और 80s के माता-पिता होने के नाते, यह अभी इसी समय भी बहुत उपयोगी होगा। मेरे आसपास के कई दोस्त भी इसी स्थिति में हैं
  • घर के कई काम humanoid के बिना automate किए जा सकते हैं। Roomba फर्श साफ़ करता है, और घरों में automatic garbage disposal और groceries को अंदर लाने, sort करने और store करने के systems लगाए जा सकते हैं
    humanoids असहज करने वाले और भरोसे लायक नहीं लगते। अगर ऐसी स्थिति हो कि आप maker के political views से असहमत हों, तो क्या ऐसा robot घर में होने पर आप आराम से सो पाएँगे, यह सवाल है

    • मौजूदा apartments, townhouses, semi-detached houses में ऐसी facilities लगाना practically impossible है, और नए single-family homes में भी यह महंगा solution है। मौजूदा human environment humanoids के हिसाब से बना हुआ है, इसलिए humanoid form उपयोगी है
    • Roomba फर्श का सिर्फ़ 80–90% साफ़ करता है और असली vacuum cleaner जितना साफ़ भी नहीं करता। dog toys हटाने और dustbin खाली करने तक को गिनें तो वास्तव में यह लगभग 60% है, इसलिए 100% संभालने के लिए पूरा human-like body चाहिए
    • ऐसी स्थिति ही नहीं होनी चाहिए जहाँ robot पर भरोसा करना पड़े। Roomba या dishwasher खराब हो जाए तो वह उंगली नहीं काट सकता और न ही चुपके से सुन या निगरानी कर सकता है; ऐसा ही अच्छा robot है
  • सीमित पृथ्वी पर लगातार बढ़ते इंसानों के ऊपर robot bodies भी क्यों जोड़ना चाहते हैं, यह समझ नहीं आता। datacenter AI कम-से-कम physical रूप से मेरे कंधे से कंधा मिलाकर competition नहीं करता; जब इंसान मौजूद हैं, फिर भी sophisticated robots क्यों चाहिए, यह नहीं समझता

    • human expansion के endless रहने के रुकने के कई संकेत हैं। sophisticated robots की जरूरत का साफ़ कारण है ऐसे काम सौंपना जो कमर तोड़ मेहनत वाले, गंदे, खतरनाक या उबाऊ हैं और जिन्हें इंसान करना नहीं चाहते
  • robot control में पूरा LLM इस्तेमाल करना बहुत भारी होगा, इसलिए powerful GPU पर भी minimum latency 1–2 seconds होने की संभावना है, और यह practical robots के लिए suitable नहीं है
    machine vision को machine learning संभाले, लेकिन motion control को पारंपरिक PID-based linear और nonlinear control पर छोड़ना चाहिए; पूरा LLM को controller की तरह इस्तेमाल करने पर hardware limits से टकराना पड़ेगा

    • मौजूदा latency problem सही है, लेकिन inference optimization की गुंजाइश बड़ी है, इसलिए near future में स्थिति बदलने की संभावना अधिक है। PID जैसे analysis/optimization-based control दशकों से stagnate हैं, जबकि end-to-end control ने walking energy efficiency और पत्तों के ढेर पर चलने पर भी न गिरने जैसी robustness में बेहतरीन performance दिखाया है, और नए robots पर apply करना भी कहीं आसान है
      Physical Intelligence जैसी कंपनियाँ intelligence और latency को साथ में solve करने के लिए fast layer और slow layer को मिलाने वाली hierarchical architecture में भी अच्छे results दे रही हैं
    • Nvidia अपने chips पर 2 billion parameter VLA को 10Hz पर चलाता है, और जहाँ तक मुझे पता है, उसका released 500 million parameter model भी 10Hz पर चलता है