Google reveals Gemini Robotics 2.0, promising improved dexterity and safety

گوگل از «جمینی روباتیکز ۲.۰» (Gemini Robotics 2.0) رونمایی کرد؛ نوید ارتقای مهارت و ایمنی

نسخه دوم جمینی روباتیکز شامل سه مدل است، اما در حال حاضر تنها یکی از آن‌ها به‌صورت عمومی در دسترس است.

ربات‌هایی که توسط مدل‌های هوش مصنوعی جمینی گوگل قدرت می‌گیرند، اکنون تواناتر شده‌اند. با انتشار جمینی روباتیکز ۲، این ربات‌های فیزیکی اکنون می‌توانند کارهای پیچیده‌تری را انجام دهند، محیط‌های در حال تغییر را به‌طور مداوم تحلیل کنند و با سایر ربات‌ها همکاری نمایند. این پیشرفت حاصل تلاش سه‌گانه از زیرمدل‌های جدید است که یکی از آن‌ها از امروز برای توسعه‌دهندگان به‌صورت عمومی قابل دسترسی است.

ویدیوهای مربوط به ربات‌های در حال دویدن، رقصیدن و پشتک زدن سال‌هاست که پای ثابت اینترنت بوده‌اند، اما این ماشین‌ها طوری برنامه‌نویسی شده بودند که فقط این کارهای بسیار محدود را انجام دهند. هدف جمینی روباتیکز ایجاد یک ربات همه‌فن‌حریف است؛ رباتی که بتواند هر کاری را که یک انسان قادر به انجامش است، انجام دهد. دانشمندان گوگل دیپ‌مایند (Google DeepMind) گاهی از این مفهوم با عنوان «AGI فیزیکی» یاد می‌کنند. در واقع، شما به ربات می‌گویید چه کاری انجام دهد و او آن را انجام می‌دهد. گوگل اعلام کرده است که با عرضه نسخه ۲.۰، هوش مصنوعی رباتیک این شرکت می‌تواند یک ربات انسان‌نمای کامل را با مهارت بهتری کنترل کند، حتی در مورد ماشین‌هایی که دست‌های انسان‌نمای پیچیده‌ای دارند.

جمینی روباتیکز ۲ هوشمندیِ تمام‌بدنی را به ربات‌ها می‌آورد.

این روند با «جمینی روباتیکز ER 2» آغاز می‌شود که یک مدل ارتقایافته‌ی «استدلال متبلور شده در تن» (embodied reasoning) است و دیپ‌مایند ادعا می‌کند جهشی چشمگیر نسبت به نسخه قبلی یعنی ۱.۶ محسوب می‌شود. این مدل با API جمینی لایو (Gemini Live) یکپارچه شده و به توسعه‌دهندگان فرصت می‌دهد تا این جهش رو به جلوی ادعا شده را تجربه کنند.

جمینی روباتیکز ER 2 چیزی است که به آن مدل بینایی-زبانی (VLM) می‌گویند. این مدل برای درک دستورالعمل‌ها و دنیای اطراف طراحی شده است. ارتقای بزرگ در اینجا این است که ER 2 می‌تواند فیدهای ویدیویی زنده را از دوربین‌های ربات پردازش کند و به سیستم اجازه دهد تا هم‌زمان با حرکت ربات از یک مرحله به مرحله دیگر، پیشرفت کار را ردیابی کند. گوگل خاطرنشان می‌کند که جمینی روباتیکز ER 2 می‌تواند کامل بودن فریم‌های ویدئویی را با دقت تقریبی ۶۰ درصد دسته‌بندی کند. این میزان هنوز با حد ایده آل فاصله زیادی دارد، اما بسیار بهتر از نسخه ۱.۶ یا توانایی‌های درک بصری مدل‌های هوش مصنوعی رقیب است.

جمینی روباتیکز ER 2 در درک جهان نسبت به سایر مدل‌ها بهتر عمل می‌کند، اما نه با اختلاف زیاد. منبع: گوگل

پیدا کردن لحظات خاص در فیدهای ویدئویی نیز برای تکمیل صحیح یک کار کلیدی است. وقتی از یک ربات می‌خواهید یک فنجان قهوه بریزد، قطعاً می‌خواهید بداند چه زمانی باید ریختن را متوقف کند. مدل ER 2 ظاهراً این کار را خیلی بهتر انجام می‌دهد و لحظات کلیدی را با دقت نزدیک به ۹۰ درصد تشخیص می‌دهد. از آنجا که ربات‌ها کارهای چندمرحله‌ای را اجرا می‌کنند، مدل استدلال تجسم‌یافته به آن‌ها اجازه می‌دهد خطاها را به صورت بلادرنگ درک کنند. سیستم می‌تواند به‌جای بازگشت به نقطه شروع، دوباره همان تک‌مرحله را امتحان کند. برای مثال، اگر توپی که ربات سعی دارد آن را بردارد غلت بخورد یا کسی ظرفی را جابه‌جا کند، ربات می‌تواند به سادگی موقعیت دست و حرکت خود را دوباره تنظیم کند.

نسخه جدید استدلال تجسم‌یافته همچنین قابلیتی است که به هوش مصنوعی ارتقایافته ربات گوگل دیپ‌مایند امکان همکاری می‌دهد. ویدیوهای نمایشی نشان می‌دهند که ربات آپترونیک آپولو ۲ (Apptronik’s Apollo 2) و فرانکا F3 دوئو (Franka F3 Duo) که ساده‌تر است، بدون مزاحمت برای یکدیگر روی یک کار مشترک با هم کار می‌کنند. اگرچه ربات‌های آزمایشی هنوز نمی‌توانند با سرعت یا ظرافت یک انسان مطابقت داشته باشند، اما ویدیوهای نمایشی شامل تصاویر بلادرنگ فراوانی از ربات‌ها در حال کار است و به نظر می‌رسد آن‌ها بسیار کمتر از آزمایش‌های قبلی دچار تردید می‌شوند.

همکاری چند رباتی با جمینی روباتیکز ۲.

درک کردن تنها قدم اول است؛ وادار کردن ربات به حرکت در دنیای فیزیکی حوزه عملکرد مدل دیگری است. پس از ترسیم کار، مدل بینایی-زبانی همeth را به یک مدل ارتقایفته‌ی بینایی-زبانی-اقدامی که به سادگی جمینی روباتیکز ۲ (Gemini Robotics 2) نامیده می‌شود، می‌سپارد. این مدل هوش مصنوعی، اقدامات ربات را از روی آن دستورالعمل‌ها تولید می‌کند؛ درست همان‌طور که سایر سیستم‌های مولد، متن یا تصویر تولید می‌کنند. همچنین یک نسخه آفلاین با تأخیر پایین از این مدل به نام «جمینی روباتیکز آن-دیوایس ۲» (Gemini Robotics On-Device 2) وجود دارد. این مدل‌ها در حال حاضر به گروه کوچکی از آزمایش‌کنندگان محدود شده‌اند.

گوگل همچنین در حال آزمایش جمینی روباتیکز ۲ روی سخت‌افزار شرکت بوستون دینامیکس (Boston Dynamics) است.

گوگل می‌گوید مدل‌های کنشی جدید بسیار دقیق‌تر و کارآمدتر هستند. حتی نسخه کوچکترِ روی دستگاه (on-device) می‌تواند تنها با چند ساعت داده حرکتی یا حدود ۲۰۰ نمونه، خود را با طرح‌های جدید ربات تطبیق دهد.

جلوگیری از آخرالزمان ربات‌ها

مسائل مربوط به توهمات هوش مصنوعی در حال حاضر کاملاً شناخته شده هستند، اما آسیب احتمالی ناشی از اشتباهات زمانی که هوش مصنوعی دارای کالبد فیزیکی است و فضای مشترکی با انسان‌ها دارد، می‌تواند بسیار بیشتر باشد. گوگل دیپ‌مایند با انتشار هر نسخه از جمینی روباتیکز تأکید کرده است که این ریسک را جدی می‌گیرد. به گفته دیپ‌مایند، هر لایه در جمینی روباتیکز شامل «اقدامات سنتی ایمنی فیزیکی به همراه چارچوب‌های قوی ایمنی هوش مصنوعی» است.

با انتشار جمینی روباتیکز ۲، یک معیار ایمنی جدید به نام ASIMOV-Agentic معرفی شده است. این آزمون، مدل‌ها را در طیف وسیعی از فاکتورهای ایمنی ارزیابی می‌کند. این آزمون می‌تواند ارزیابی کند که آیا یک عامل استدلال تجسم‌یافته، فراخوانی ابزارهای ناامن از یک VLA را رد خواهد کرد یا خیر. همچنین می‌تواند تعیین کند که آیا انجام یک کار مشخص به‌طور ایمن امکان‌پذیر است یا خیر، و اینکه آیا مدل قادر است در صورت عدم اطمینان نسبت به ایمنی، درخواست کمک انسانی کند.

گوگل دیپ‌مایند خاطرنشان می‌کند که جمینی روباتیکز ER 2 ایمن‌ترین مدل این تیم تا به امروز است و توانایی فوق‌العاده‌ای در درک ایمنی و متوقف کردن اقدامات زمانی که یک انسان بیش از حد به ربات نزدیک است، از خود نشان می‌دهد. معیار ایمنی جدید گوگل به‌طور کامل در هاگینگ فیس (Hugging Face) در دسترس است.

نظر مهندس بهمن آبادی: گام بزرگ جمینی روباتیکز ۲.۰ در پردازش بلادرنگ فیدهای ویدیویی و مدیریت خطا، چالش دیرینهٔ عدم قطعیت در دنیای فیزیکی را به‌شدت کاهش می‌دهد. به عنوان یک توسعه‌دهنده، قابلیت انطباق مدل‌های On-Device با حداقل داده‌های آموزشی، زحمت کالیبراسیون سخت‌افزار را کم کرده و تمرکز ما را از لایه‌های کنترلی پایین‌سطح، به منطق اجرایی و معماری سیستم‌های چندعاملی معطوف می‌کند.

منبع: https://arstechnica.com/ai/2026/07/google-reveals-gemini-robotics-2-0-promising-improved-dexterity-and-safety