گوگل از «جمینی روباتیکز ۲.۰» (Gemini Robotics 2.0) رونمایی کرد؛ نوید ارتقای مهارت و ایمنی
نسخه دوم جمینی روباتیکز شامل سه مدل است، اما در حال حاضر تنها یکی از آنها بهصورت عمومی در دسترس است.
رباتهایی که توسط مدلهای هوش مصنوعی جمینی گوگل قدرت میگیرند، اکنون تواناتر شدهاند. با انتشار جمینی روباتیکز ۲، این رباتهای فیزیکی اکنون میتوانند کارهای پیچیدهتری را انجام دهند، محیطهای در حال تغییر را بهطور مداوم تحلیل کنند و با سایر رباتها همکاری نمایند. این پیشرفت حاصل تلاش سهگانه از زیرمدلهای جدید است که یکی از آنها از امروز برای توسعهدهندگان بهصورت عمومی قابل دسترسی است.
ویدیوهای مربوط به رباتهای در حال دویدن، رقصیدن و پشتک زدن سالهاست که پای ثابت اینترنت بودهاند، اما این ماشینها طوری برنامهنویسی شده بودند که فقط این کارهای بسیار محدود را انجام دهند. هدف جمینی روباتیکز ایجاد یک ربات همهفنحریف است؛ رباتی که بتواند هر کاری را که یک انسان قادر به انجامش است، انجام دهد. دانشمندان گوگل دیپمایند (Google DeepMind) گاهی از این مفهوم با عنوان «AGI فیزیکی» یاد میکنند. در واقع، شما به ربات میگویید چه کاری انجام دهد و او آن را انجام میدهد. گوگل اعلام کرده است که با عرضه نسخه ۲.۰، هوش مصنوعی رباتیک این شرکت میتواند یک ربات انساننمای کامل را با مهارت بهتری کنترل کند، حتی در مورد ماشینهایی که دستهای انساننمای پیچیدهای دارند.
جمینی روباتیکز ۲ هوشمندیِ تمامبدنی را به رباتها میآورد.
این روند با «جمینی روباتیکز ER 2» آغاز میشود که یک مدل ارتقایافتهی «استدلال متبلور شده در تن» (embodied reasoning) است و دیپمایند ادعا میکند جهشی چشمگیر نسبت به نسخه قبلی یعنی ۱.۶ محسوب میشود. این مدل با API جمینی لایو (Gemini Live) یکپارچه شده و به توسعهدهندگان فرصت میدهد تا این جهش رو به جلوی ادعا شده را تجربه کنند.
جمینی روباتیکز ER 2 چیزی است که به آن مدل بینایی-زبانی (VLM) میگویند. این مدل برای درک دستورالعملها و دنیای اطراف طراحی شده است. ارتقای بزرگ در اینجا این است که ER 2 میتواند فیدهای ویدیویی زنده را از دوربینهای ربات پردازش کند و به سیستم اجازه دهد تا همزمان با حرکت ربات از یک مرحله به مرحله دیگر، پیشرفت کار را ردیابی کند. گوگل خاطرنشان میکند که جمینی روباتیکز ER 2 میتواند کامل بودن فریمهای ویدئویی را با دقت تقریبی ۶۰ درصد دستهبندی کند. این میزان هنوز با حد ایده آل فاصله زیادی دارد، اما بسیار بهتر از نسخه ۱.۶ یا تواناییهای درک بصری مدلهای هوش مصنوعی رقیب است.
پیدا کردن لحظات خاص در فیدهای ویدئویی نیز برای تکمیل صحیح یک کار کلیدی است. وقتی از یک ربات میخواهید یک فنجان قهوه بریزد، قطعاً میخواهید بداند چه زمانی باید ریختن را متوقف کند. مدل ER 2 ظاهراً این کار را خیلی بهتر انجام میدهد و لحظات کلیدی را با دقت نزدیک به ۹۰ درصد تشخیص میدهد. از آنجا که رباتها کارهای چندمرحلهای را اجرا میکنند، مدل استدلال تجسمیافته به آنها اجازه میدهد خطاها را به صورت بلادرنگ درک کنند. سیستم میتواند بهجای بازگشت به نقطه شروع، دوباره همان تکمرحله را امتحان کند. برای مثال، اگر توپی که ربات سعی دارد آن را بردارد غلت بخورد یا کسی ظرفی را جابهجا کند، ربات میتواند به سادگی موقعیت دست و حرکت خود را دوباره تنظیم کند.
نسخه جدید استدلال تجسمیافته همچنین قابلیتی است که به هوش مصنوعی ارتقایافته ربات گوگل دیپمایند امکان همکاری میدهد. ویدیوهای نمایشی نشان میدهند که ربات آپترونیک آپولو ۲ (Apptronik’s Apollo 2) و فرانکا F3 دوئو (Franka F3 Duo) که سادهتر است، بدون مزاحمت برای یکدیگر روی یک کار مشترک با هم کار میکنند. اگرچه رباتهای آزمایشی هنوز نمیتوانند با سرعت یا ظرافت یک انسان مطابقت داشته باشند، اما ویدیوهای نمایشی شامل تصاویر بلادرنگ فراوانی از رباتها در حال کار است و به نظر میرسد آنها بسیار کمتر از آزمایشهای قبلی دچار تردید میشوند.
همکاری چند رباتی با جمینی روباتیکز ۲.
درک کردن تنها قدم اول است؛ وادار کردن ربات به حرکت در دنیای فیزیکی حوزه عملکرد مدل دیگری است. پس از ترسیم کار، مدل بینایی-زبانی همeth را به یک مدل ارتقایفتهی بینایی-زبانی-اقدامی که به سادگی جمینی روباتیکز ۲ (Gemini Robotics 2) نامیده میشود، میسپارد. این مدل هوش مصنوعی، اقدامات ربات را از روی آن دستورالعملها تولید میکند؛ درست همانطور که سایر سیستمهای مولد، متن یا تصویر تولید میکنند. همچنین یک نسخه آفلاین با تأخیر پایین از این مدل به نام «جمینی روباتیکز آن-دیوایس ۲» (Gemini Robotics On-Device 2) وجود دارد. این مدلها در حال حاضر به گروه کوچکی از آزمایشکنندگان محدود شدهاند.
گوگل همچنین در حال آزمایش جمینی روباتیکز ۲ روی سختافزار شرکت بوستون دینامیکس (Boston Dynamics) است.
گوگل میگوید مدلهای کنشی جدید بسیار دقیقتر و کارآمدتر هستند. حتی نسخه کوچکترِ روی دستگاه (on-device) میتواند تنها با چند ساعت داده حرکتی یا حدود ۲۰۰ نمونه، خود را با طرحهای جدید ربات تطبیق دهد.
جلوگیری از آخرالزمان رباتها
مسائل مربوط به توهمات هوش مصنوعی در حال حاضر کاملاً شناخته شده هستند، اما آسیب احتمالی ناشی از اشتباهات زمانی که هوش مصنوعی دارای کالبد فیزیکی است و فضای مشترکی با انسانها دارد، میتواند بسیار بیشتر باشد. گوگل دیپمایند با انتشار هر نسخه از جمینی روباتیکز تأکید کرده است که این ریسک را جدی میگیرد. به گفته دیپمایند، هر لایه در جمینی روباتیکز شامل «اقدامات سنتی ایمنی فیزیکی به همراه چارچوبهای قوی ایمنی هوش مصنوعی» است.
با انتشار جمینی روباتیکز ۲، یک معیار ایمنی جدید به نام ASIMOV-Agentic معرفی شده است. این آزمون، مدلها را در طیف وسیعی از فاکتورهای ایمنی ارزیابی میکند. این آزمون میتواند ارزیابی کند که آیا یک عامل استدلال تجسمیافته، فراخوانی ابزارهای ناامن از یک VLA را رد خواهد کرد یا خیر. همچنین میتواند تعیین کند که آیا انجام یک کار مشخص بهطور ایمن امکانپذیر است یا خیر، و اینکه آیا مدل قادر است در صورت عدم اطمینان نسبت به ایمنی، درخواست کمک انسانی کند.
گوگل دیپمایند خاطرنشان میکند که جمینی روباتیکز ER 2 ایمنترین مدل این تیم تا به امروز است و توانایی فوقالعادهای در درک ایمنی و متوقف کردن اقدامات زمانی که یک انسان بیش از حد به ربات نزدیک است، از خود نشان میدهد. معیار ایمنی جدید گوگل بهطور کامل در هاگینگ فیس (Hugging Face) در دسترس است.
نظر مهندس بهمن آبادی: گام بزرگ جمینی روباتیکز ۲.۰ در پردازش بلادرنگ فیدهای ویدیویی و مدیریت خطا، چالش دیرینهٔ عدم قطعیت در دنیای فیزیکی را بهشدت کاهش میدهد. به عنوان یک توسعهدهنده، قابلیت انطباق مدلهای On-Device با حداقل دادههای آموزشی، زحمت کالیبراسیون سختافزار را کم کرده و تمرکز ما را از لایههای کنترلی پایینسطح، به منطق اجرایی و معماری سیستمهای چندعاملی معطوف میکند.