CoreTech

Gemini Robotics ER 2

گوگل از Gemini Robotics ER 2 رونمایی کرد؛ مغز جدید ربات‌ها برای انجام وظایف پیچیده

ابوالفضل | ۱۶ ساعت پیش

گوگل از مدل جدید Gemini Robotics ER 2 رونمایی کرده است؛ مدلی که به‌عنوان پیشرفته‌ترین سیستم استدلال تجسم‌یافته این شرکت برای ربات‌ها معرفی می‌شود. این مدل با هدف افزایش توانایی ربات‌ها در درک محیط، گفت‌وگو با انسان، برنامه‌ریزی وظایف چندمرحله‌ای و همکاری با چند ربات دیگر توسعه یافته است. همچنین می‌تواند هم‌زمان با اجرای وظایف، درباره مراحل بعدی تصمیم‌گیری کند و اجرای حرکات را به مدل‌های سطح پایین Vision-Language-Action یا VLA بسپارد.

نسخه جدید نسبت به Gemini Robotics ER 1.6 پیشرفت قابل‌توجهی داشته است و این مدل با تحلیل مداوم جریان ویدئو، روند انجام کار را زیر نظر می‌گیرد، در صورت بروز مشکل مسیر خود را اصلاح می‌کند و زمان مناسب برای آغاز مرحله بعد را تشخیص می‌دهد. علاوه بر این، Gemini Robotics ER 2 به‌صورت بومی از ابزارهایی مانند Google Search و توابع تعریف‌شده توسط کاربر پشتیبانی می‌کند و اکنون از طریق Gemini API، Google AI Studio و نسخه پیش‌نمایش خصوصی Gemini Enterprise Agent Platform در اختیار توسعه‌دهندگان قرار گرفته است.

گوگل می‌گوید این مدل برای انجام وظایف پیچیده دنیای واقعی به‌عنوان یک عامل فیزیکی عمل می‌کند و مراحل مختلف را هماهنگ می‌سازد. توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح پایین مانند مدل‌های VLA یا APIهای ناوبری را به‌عنوان ابزار معرفی کنند و ویدئو، صدا یا متن را به‌صورت مستقیم به مدل ارسال کنند. همچنین Gemini Robotics ER 2 در Gemini Live API ادغام شده و با استفاده از ارتباط دوطرفه کم‌تأخیر، بدون توقف‌های طولانی میان مراحل مختلف، وظایف را مدیریت می‌کند.

نتایج بنچمارک Gemini Robotics ER 2:

برای نمایش توانایی‌های جمنای روباتیک ER 2، گوگل نمونه‌ای را با ربات Spot شرکت Boston Dynamics ارائه کرده است که در این نمونه، Gemini Robotics ER 2 وظیفه هماهنگ‌سازی APIهای مربوط به حرکت و ناوبری Spot را بر عهده دارد تا ربات بتواند به‌صورت تعاملی اشیا را برای کاربر جابه‌جا کند. گوگل همچنین اعلام کرده است که مدل جدید در تشخیص پایان صحیح وظایف پیچیده، مانند بستن کیسه زباله یا سفت کردن لامپ، پیشرفت چشمگیری داشته است.

این پیشرفت به لطف دو قابلیت جدید یعنی طبقه‌بندی پیوسته پیشرفت و یافتن لحظه حاصل شده است. در روش نخست، هر فریم ویدئو در یکی از پنج سطح پیشرفت شامل ۰ تا ۲۰، ۲۰ تا ۴۰، ۴۰ تا ۶۰، ۶۰ تا ۸۰ و ۸۰ تا ۱۰۰ درصد قرار می‌گیرد تا ربات بتواند وضعیت انجام کار را به‌صورت لحظه‌ای ارزیابی کرده و در صورت نیاز، تنها مرحله ناموفق را دوباره اجرا کند. قابلیت دوم نیز زمان دقیق وقوع رویدادهای مهم، مانند توقف ریختن قهوه در فنجان، را تشخیص می‌دهد.

گوگل در Gemini Robotics ER 2 امکان همکاری چند ربات را نیز فراهم کرده است؛ قابلیتی که به ماشین‌های مختلف اجازه می‌دهد با تکیه بر درک معنایی مشترک، وظایف را میان خود تقسیم کرده و فرایندهایی را انجام دهند که از توان یک ربات خارج است. این شرکت برای نمایش این قابلیت، همکاری میان ربات Apollo 2 شرکت Apptronik و Franka F3 Duo را به نمایش گذاشته است. همچنین توانایی‌های استدلال فضایی مدل در سه بخش تشخیص موفقیت یا شکست از روی ویدئو، خواندن انواع ابزارهای اندازه‌گیری و پاسخ‌گویی دیداری فضایی نیز ارتقا یافته است.

گوگل اعلام کرده است Gemini Robotics ER 2 ایمن‌ترین مدل رباتیکی این شرکت محسوب می‌شود و عملکرد بهتری در معیارهای Safety Instruction Following و Human Proximity ثبت کرده است. به گفته این شرکت، مدل می‌تواند هنگام حضور انسان در نزدیکی ربات، فعالیت را متوقف کرده و پس از ایمن شدن محیط، به‌طور خودکار ادامه کار را از سر بگیرد. گوگل همچنین معیار جدیدی برای ارزیابی ایمنی هماهنگ‌کننده‌های VLA معرفی کرده و تأکید دارد در ادامه توسعه این فناوری، تمرکز خود را بر انجام وظایف پیچیده‌تر و حمایت از جامعه رباتیک حفظ خواهد کرد.

منبع

ابوالفضل | ۱۶ ساعت پیش

دیدگاهتان را بنویسید