
گوگل از Gemini Robotics ER 2 رونمایی کرد؛ مغز جدید رباتها برای انجام وظایف پیچیده
گوگل از مدل جدید Gemini Robotics ER 2 رونمایی کرده است؛ مدلی که بهعنوان پیشرفتهترین سیستم استدلال تجسمیافته این شرکت برای رباتها معرفی میشود. این مدل با هدف افزایش توانایی رباتها در درک محیط، گفتوگو با انسان، برنامهریزی وظایف چندمرحلهای و همکاری با چند ربات دیگر توسعه یافته است. همچنین میتواند همزمان با اجرای وظایف، درباره مراحل بعدی تصمیمگیری کند و اجرای حرکات را به مدلهای سطح پایین Vision-Language-Action یا VLA بسپارد.
نسخه جدید نسبت به Gemini Robotics ER 1.6 پیشرفت قابلتوجهی داشته است و این مدل با تحلیل مداوم جریان ویدئو، روند انجام کار را زیر نظر میگیرد، در صورت بروز مشکل مسیر خود را اصلاح میکند و زمان مناسب برای آغاز مرحله بعد را تشخیص میدهد. علاوه بر این، Gemini Robotics ER 2 بهصورت بومی از ابزارهایی مانند Google Search و توابع تعریفشده توسط کاربر پشتیبانی میکند و اکنون از طریق Gemini API، Google AI Studio و نسخه پیشنمایش خصوصی Gemini Enterprise Agent Platform در اختیار توسعهدهندگان قرار گرفته است.
گوگل میگوید این مدل برای انجام وظایف پیچیده دنیای واقعی بهعنوان یک عامل فیزیکی عمل میکند و مراحل مختلف را هماهنگ میسازد. توسعهدهندگان میتوانند رابطهای کنترلی سطح پایین مانند مدلهای VLA یا APIهای ناوبری را بهعنوان ابزار معرفی کنند و ویدئو، صدا یا متن را بهصورت مستقیم به مدل ارسال کنند. همچنین Gemini Robotics ER 2 در Gemini Live API ادغام شده و با استفاده از ارتباط دوطرفه کمتأخیر، بدون توقفهای طولانی میان مراحل مختلف، وظایف را مدیریت میکند.
نتایج بنچمارک Gemini Robotics ER 2:





برای نمایش تواناییهای جمنای روباتیک ER 2، گوگل نمونهای را با ربات Spot شرکت Boston Dynamics ارائه کرده است که در این نمونه، Gemini Robotics ER 2 وظیفه هماهنگسازی APIهای مربوط به حرکت و ناوبری Spot را بر عهده دارد تا ربات بتواند بهصورت تعاملی اشیا را برای کاربر جابهجا کند. گوگل همچنین اعلام کرده است که مدل جدید در تشخیص پایان صحیح وظایف پیچیده، مانند بستن کیسه زباله یا سفت کردن لامپ، پیشرفت چشمگیری داشته است.
این پیشرفت به لطف دو قابلیت جدید یعنی طبقهبندی پیوسته پیشرفت و یافتن لحظه حاصل شده است. در روش نخست، هر فریم ویدئو در یکی از پنج سطح پیشرفت شامل ۰ تا ۲۰، ۲۰ تا ۴۰، ۴۰ تا ۶۰، ۶۰ تا ۸۰ و ۸۰ تا ۱۰۰ درصد قرار میگیرد تا ربات بتواند وضعیت انجام کار را بهصورت لحظهای ارزیابی کرده و در صورت نیاز، تنها مرحله ناموفق را دوباره اجرا کند. قابلیت دوم نیز زمان دقیق وقوع رویدادهای مهم، مانند توقف ریختن قهوه در فنجان، را تشخیص میدهد.
گوگل در Gemini Robotics ER 2 امکان همکاری چند ربات را نیز فراهم کرده است؛ قابلیتی که به ماشینهای مختلف اجازه میدهد با تکیه بر درک معنایی مشترک، وظایف را میان خود تقسیم کرده و فرایندهایی را انجام دهند که از توان یک ربات خارج است. این شرکت برای نمایش این قابلیت، همکاری میان ربات Apollo 2 شرکت Apptronik و Franka F3 Duo را به نمایش گذاشته است. همچنین تواناییهای استدلال فضایی مدل در سه بخش تشخیص موفقیت یا شکست از روی ویدئو، خواندن انواع ابزارهای اندازهگیری و پاسخگویی دیداری فضایی نیز ارتقا یافته است.
گوگل اعلام کرده است Gemini Robotics ER 2 ایمنترین مدل رباتیکی این شرکت محسوب میشود و عملکرد بهتری در معیارهای Safety Instruction Following و Human Proximity ثبت کرده است. به گفته این شرکت، مدل میتواند هنگام حضور انسان در نزدیکی ربات، فعالیت را متوقف کرده و پس از ایمن شدن محیط، بهطور خودکار ادامه کار را از سر بگیرد. گوگل همچنین معیار جدیدی برای ارزیابی ایمنی هماهنگکنندههای VLA معرفی کرده و تأکید دارد در ادامه توسعه این فناوری، تمرکز خود را بر انجام وظایف پیچیدهتر و حمایت از جامعه رباتیک حفظ خواهد کرد.




