- Google DeepMind ने Gemini Robotics 2 मॉडल फैमिली पेश की है, जो visual और language input को actions में बदलकर humanoid के पैरों से लेकर उंगलियों तक नियंत्रण करती है, और सटीक manipulation तथा robots के बीच collaboration को support करती है
- इस मॉडल फैमिली में whole-body control के लिए VLA Gemini Robotics 2, लंबे कार्यों की planning और supervision के लिए Gemini Robotics ER 2, और robot पर local रूप से चलने वाला Gemini Robotics On-Device 2 शामिल हैं
- Humanoid चलना, झुकना और वस्तुएं ले जाना एक साथ कर सकते हैं, और 22 degrees of freedom वाली 5-उंगली hand से knot बांध सकते हैं या zipper bag seal कर सकते हैं; कई robots ऐसे कामों में मिलकर काम कर सकते हैं जिन्हें अकेला robot संभालना मुश्किल हो
- On-Device 2 बिना network connection के चलता है, और आम तौर पर 200 से कम examples तथा कुछ घंटों की adaptation process के साथ इसे ऐसे नए dual-arm robots पर लागू किया जा सकता है जिनकी form, sensors और degrees of freedom काफी अलग हों
- ER 2, Google AI Studio और Gemini Enterprise Agent Platform पर private preview में उपलब्ध है, और VLA व On-Device models early access partners के लिए खुले हैं, लेकिन movement speed और precision में अभी भी सुधार की जरूरत है
अलग-अलग भूमिकाओं वाले तीन robot models
- मौजूदा robots आम तौर पर पहले से programmed या remotely operated, संकीर्ण और दोहराए जाने वाले task sequences पर निर्भर रहे हैं, इसलिए उनके लिए अप्रत्याशित environment में खुद adapt करना या एक robot की skill को दूसरे form factor में transfer करना मुश्किल होता है
- Gemini Robotics 2 visual और language input को motor control में बदलने वाला vision-language-action model (VLA) है
- यह पूरे humanoid और dual-arm robots को control करता है
- यह दोनों hands और grippers के जरिए सटीक manipulation को support करता है
- Gemini Robotics ER 2 robot के agent की भूमिका निभाने वाला embodied reasoning (ER) model है
- यह लोगों से communicate करता है और physical environment को समझता है
- यह कई मिनट तक चलने वाले multi-step tasks की planning करता है
- यह कई robots की team-based work को support करता है
- Gemini Robotics On-Device 2 एक efficient VLA है जिसे robot device पर local रूप से चलाने के लिए optimize किया गया है
- यह कुछ घंटों के data से पूरी तरह नए robot forms के अनुकूल हो सकता है
- हर model की availability अलग है
- ER 2 को Google AI Studio में इस्तेमाल किया जा सकता है, और Gemini Enterprise Agent Platform पर यह private preview में उपलब्ध है
- VLA और On-Device models early access partners को उपलब्ध हैं
- hardware implementation का तरीका Developer blog में देखा जा सकता है
ऊपरी धड़ से आगे, humanoid का पूरे शरीर का नियंत्रण
- अगर पिछला model tabletop tasks के लिए humanoid upper body control पर केंद्रित था, तो Gemini Robotics 2 ने नियंत्रण का दायरा बढ़ाकर whole-body motion तक पहुंचा दिया है
- Apptronik Apollo 2 “watering can को नीचे वाली shelf के हरे box में रखो” जैसे निर्देश को संभाल सकता है
- यह table तक चलकर watering can उठाता है
- फिर shelf तक जाकर उसे तय जगह पर सही तरीके से रख देता है
- यह चलना, झुकना, balance बनाए रखना और वस्तुओं को manipulate करना जोड़कर तंग और बिखरे हुए spaces में काम करता है, लेकिन movement speed में अभी और सुधार चाहिए
hands और grippers से सटीक manipulation
- Apollo 2 में लगे SharpaWave hand की पांच उंगलियों और 22 degrees of freedom को control किया जाता है
- यह knot बांधने जैसी नाजुक movements कर सकता है
- यह zipper bag seal कर सकता है
- Franka Duo के standard two-finger parallel gripper के साथ यह घनी packing जैसे जटिल tasks भी संभालता है
- इंसानी स्तर की dexterity तक पहुंचने के लिए precision और speed को लगातार बढ़ाना होगा
long-horizon task reasoning और multi-robot collaboration
- Gemini Robotics ER 2 robot के high-level brain की तरह user instructions को process करता है और लोगों से communicate करता है
- यह space को observe करके जरूरी steps का अनुमान लगाता है
- यह VLA के साथ coordinate करके actual actions करवाता है
- यह task पूरा होने तक progress track करता है
- जटिल multi-step tasks के दौरान अगर कोई step fail हो जाए तो यह self-correct कर सकता है, और नई situations व goals पर generalize भी कर सकता है
- यह एक task में सैकड़ों बार decisions लेता है, और कई मिनट तक चलने वाली task sequences को पहले से ज्यादा स्थिरता से संभालता है
- यह task की शुरुआत और अंत को समझता है, और key events कब हुए इसकी पहचान कर progress state को track करता है
- अलग-अलग प्रकार के robots एक-दूसरे से communicate और collaborate करके ऐसे जटिल workflows संभाल सकते हैं जिन्हें अकेला robot करना मुश्किल हो
नए robot forms के लिए तेज adaptation
- Gemini Robotics On-Device 2 उन environments के लिए robot device पर local execution करता है जहां network latency या internet connection के बिना काम करना जरूरी हो
- यह कई robot forms को base support देता है और Gemini Robotics 1.5 की motion transfer technology को आगे बढ़ाता है
- आम तौर पर 200 से कम examples और कुछ घंटों की adaptation process के साथ इसे नए dual-arm robots पर लागू किया जा सकता है
- यह appearance, sensors और degrees of freedom में काफी अलग robots पर भी adapt करता है, और Dexmate, SO101, Trossen platforms पर अलग-अलग tasks करता है
uncertainty तक संभालने वाली robot safety
- जैसे-जैसे robots की physical capabilities बढ़ती हैं, वैसे-वैसे पारंपरिक physical safety measures और AI safety framework को मिलाकर multi-layered safety approach लागू की जाती है
- ASIMOV-Agentic agent safety coordination और uncertainty handling का आकलन करने वाला नया benchmark है
- यह मापता है कि embodied reasoning agent, VLA द्वारा मांगे गए unsafe tool calls को reject कर सकता है या नहीं
- यह इस बात का आकलन करता है कि क्या system task success की संभावना का अनुमान लगाता है और uncertainty होने पर proactively human intervention मांगता है
- Gemini Robotics ER 2 ने safety constraints compliance और human proximity benchmarks में Google DeepMind के मौजूदा robot models में सबसे सुरक्षित performance दिखाई है
- यह आसपास मौजूद लोगों को बेहतर detect करता है
- जब कोई व्यक्ति बहुत करीब आ जाता है, तो यह safety tools call करता है और robot को सुरक्षित रूप से stop कर देता है
- यह लोगों के साथ काम करने के लिए collaborative safety standards में जरूरी capability है
- विस्तृत evaluation Gemini Robotics 2: Safety Technical Report में देखी जा सकती है
- लक्ष्य केवल single-task automation से आगे बढ़कर, लोगों के साथ मिलकर जटिल समस्याएं हल करने वाली general-purpose physical AI की core intelligence बनाना है
1 टिप्पणियां
Hacker News की राय
इस मॉडल के विकास में शामिल DeepMind researcher के रूप में, DeepMind काम करने के लिए अच्छी जगह है। Gemini·Gemma, robotics, मौसम और biology जैसे science क्षेत्रों सहित intelligence से जुड़े लगभग हर क्षेत्र में आवाजाही कर सकने वाली कुछ गिनी-चुनी अनोखी research labs में से एक है, और यहाँ बेहतरीन सहकर्मी हैं, इसलिए जुड़ने पर विचार किया जा सकता है
Anthropic और OpenAI 80% attention ले जाते हैं, लेकिन Google जिस दायरे में frontier-grade, high-speed, open-weight models से लेकर image, video, music generation और robotics तक कर रहा है, वह प्रभावशाली है
robot की movements धीमी और smooth नहीं हैं, लेकिन शुरुआती ChatGPT भी बहुत सुस्त दिखता था। अगर यह LLM जितनी तेजी से विकसित हुआ, तो कुछ सालों में इसका उपयोग-क्षेत्र बहुत बड़ा हो सकता है
धीमी और static robot movements और तेज, flexible movements की difficulty बिल्कुल अलग है। तेजी से चलने पर कई joints और masses की rotational inertia, balance changes को प्रति सेकंड सैकड़ों से हजारों बार calculate करना पड़ता है। रुकी हुई स्थिति में T-shirt को 90% probability से fold करना आसान है, लेकिन 99% success rate या fast folding अविश्वसनीय रूप से complex है
उनसे digital doll की तरह inverse kinematics movements को हूबहू imitate करने की उम्मीद नहीं करनी चाहिए। अगर optimization goal energy consumption कम करना है, तो multi-joint electric arm की movements कुछ अजीब दिख सकती हैं
humanoid robots से उम्मीद actuators की limits के कारण छोड़ दी है। Honda ASIMO के बाद innovation बहुत कम हुई, और शायद कोई भी अपने घर या workplace में 80kg का डगमगाता metal का ढेर नहीं रखना चाहेगा
अंतिम robot revolution दिमाग की जगह बदले हुए genetically modified human/animal bodies का इस्तेमाल कर सकती है। मेरा मानना है कि consciousness न होने के लिए बनाए गए bear को Neuralink और LLM से control किया जाए तो वह construction worker के रूप में ज्यादा suitable होगा; तेज animals delivery में और giraffes warehouses में उपयोगी हो सकते हैं
3D printing क्षेत्र में दिलचस्प काम देखकर मुझे लगता था कि actuators भी काफी आगे बढ़ रहे हैं, इसलिए पीछे रह जाने वाले दावे के बारे में और जानना चाहूँगा
dishwasher की तरह input process कर output देने वाला एक बड़ा box बनाया जा सकता है। इंसानी हाथ की नकल करने के बजाय washing machine और dryer के counterpart के रूप में clothes-folding device या integrated robotic kitchen बनाना कहीं ज्यादा efficient होगा
इस तकनीक के वास्तविक स्तर का ईमानदार आकलन करने वाला कोई चाहिए। जरूरी मापन उपकरण, interaction quality, दरवाज़े का हैंडल घुमाने और गिरने के बाद संभलने, collision avoidance जैसे असंरचित रोज़मर्रा के कामों में प्रदर्शन जानना चाहता हूँ
भरोसेमंद accuracy data भी कम है, और LIBERO जैसे benchmarks में लगभग सभी 95% score कर रहे हैं, इसलिए वे saturate हो चुके हैं; कंपनियाँ और शोधकर्ता अपनी-अपनी evaluation इस्तेमाल करते हैं। कई कंपनियाँ demo में धोखा देती हैं या इंसानों के पास खतरनाक तरीके से इन्हें चलाती हैं
दरवाज़े के हैंडल और fall recovery से भी ज़्यादा मुश्किल manufacturing process में bricks या parts को सटीक तरीके से align करना है। इतने सारे joints manage करने वाले जटिल humanoid की तुलना में Mobile ALOHA जैसे पहियों वाले robot arms hotel rooms की सफ़ाई या तयशुदा काम वाले restaurant cooking के लिए ज़्यादा उपयुक्त लगते हैं
https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex... के तर्क की तरह, dexterity hardware problem भी है, और gripper हाथ नहीं होता। Multi-finger hand manipulation भी अब तक मुश्किल है और sensors भी पर्याप्त नहीं हैं
robotics, collaborative robots के क्षेत्र को छोड़कर, niche industry है; exception drones हैं, जिनमें सिर्फ़ flight time की समस्या हल हो जाए तो बड़ा potential है। humanoids को real environments में useful बनने में अभी लंबा समय लगेगा, और ज़्यादातर unmanned ground vehicles सीढ़ियों पर पीछे तक नहीं जा सकते
AI robotics ही असली revolution है। अभी capital holders को और capital पाने के लिए human labor चाहिए, लेकिन जब robot inference cost wages से कम हो जाएगी, तो human labor की जरूरत नहीं रहेगी। AI non-physical labor को भी प्रभावित करता है, लेकिन दुनिया की बड़ी आबादी physical labor में लगी है
47 साल का बिना बच्चों वाला पुरुष होने के नाते, बुढ़ापे में care robots की मदद मिलने की संभावना से उम्मीद रखता हूँ
घर के कई काम humanoid के बिना automate किए जा सकते हैं। Roomba फर्श साफ़ करता है, और घरों में automatic garbage disposal और groceries को अंदर लाने, sort करने और store करने के systems लगाए जा सकते हैं
humanoids असहज करने वाले और भरोसे लायक नहीं लगते। अगर ऐसी स्थिति हो कि आप maker के political views से असहमत हों, तो क्या ऐसा robot घर में होने पर आप आराम से सो पाएँगे, यह सवाल है
सीमित पृथ्वी पर लगातार बढ़ते इंसानों के ऊपर robot bodies भी क्यों जोड़ना चाहते हैं, यह समझ नहीं आता। datacenter AI कम-से-कम physical रूप से मेरे कंधे से कंधा मिलाकर competition नहीं करता; जब इंसान मौजूद हैं, फिर भी sophisticated robots क्यों चाहिए, यह नहीं समझता
robot control में पूरा LLM इस्तेमाल करना बहुत भारी होगा, इसलिए powerful GPU पर भी minimum latency 1–2 seconds होने की संभावना है, और यह practical robots के लिए suitable नहीं है
machine vision को machine learning संभाले, लेकिन motion control को पारंपरिक PID-based linear और nonlinear control पर छोड़ना चाहिए; पूरा LLM को controller की तरह इस्तेमाल करने पर hardware limits से टकराना पड़ेगा
Physical Intelligence जैसी कंपनियाँ intelligence और latency को साथ में solve करने के लिए fast layer और slow layer को मिलाने वाली hierarchical architecture में भी अच्छे results दे रही हैं