CoreTech

Google Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking

گوگل دو مدل صوتی جدید Gemini 3.8 Live و نسخه‌ی Extended Thinking را معرفی کرد

ابوالفضل | ۱ ساعت پیش

گوگل دو مدل صوتی جدید Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را معرفی کرده است؛ مدل‌هایی که با تمرکز بر استدلال تقریباً بلادرنگ، مکالمه طبیعی‌تر و اجرای وظایف پیچیده با صدا طراحی شده‌اند. نسخه لایو برای مقیاس‌پذیری و کاهش هزینه ساخته شده و هم‌زمان هوش مکالمه‌ای، گفت‌وگوی روان و درک بصری را ارائه می‌کند. نسخه Extended Thinking نیز برای کارهای پیچیده‌تر و استدلال چندمرحله‌ای توسعه یافته است.

Gemini 3.8 Live Extended Thinking در شاخص کیفیت گفتار به گفتار Artificial Analysis با امتیاز ۸۲.۶ رتبه نخست را به دست آورده و در تکمیل وظایف عامل‌محور نیز عملکرد قابل‌توجهی دارد. این مدل در τ-Voice امتیاز ۶۸.۶ درصد و در معیار بانکی τ-Voice شرکت Sierra امتیاز ۳۵.۱ درصد گرفته است. همچنین امتیاز ۹۷.۷ درصد در Big Bench Audio را ثبت می‌کند و در مقایسه با مدل‌های پیشرفته، قیمت رقابتی دارد.

نسخه معمولی Gemini 3.8 Live نیز در Speech Agent Arena جایگاه دوم را کسب کرده است. گوگل می‌گوید این مدل در کنار این عملکرد، هزینه‌بر بودن را کنترل می‌کند و گزینه‌ای توانمند و کارآمد برای توسعه‌دهندگان و سازمان‌هایی است که به دنبال ساخت عامل‌های صوتی در مقیاس بالا هستند. در EVA-Bench سرویس ServiceNow نیز هر دو مدل در گردش‌کارهای پیچیده، مرز پارتو میان دقت و کیفیت مکالمه را جابه‌جا کرده‌اند.

Gemini 3.8 Live می‌تواند ورودی‌های بصری را تقریباً به‌صورت بلادرنگ پردازش کند تا پاسخ‌ها را با زمینه بیشتری ارائه دهد. این مدل همچنین قادر است هنگام ادامه مکالمه، به‌طور خودکار میان ۹۷ زبان پشتیبانی‌شده جابه‌جا شود. اجرای ابزارها و فراخوانی API نیز در پس‌زمینه انجام می‌شود؛ بنابراین مدل می‌تواند ضمن تأیید درخواست کاربر و ادامه گفت‌وگو، منتظر پایان فرآیندهای اجرایی نماند و وظایف را هم‌زمان پیش ببرد.

برای کارهایی که به استدلال عمیق‌تر نیاز دارند، Gemini 3.8 Live Extended Thinking می‌تواند هم‌زمان با فکر کردن، صحبت کند. مدل برای حفظ جریان طبیعی مکالمه، درخواست را با عبارت‌هایی مانند «اجازه بده بررسی کنم…» تأیید می‌کند و در جریان وظایف چندمرحله‌ای پس‌زمینه، پیشرفت کار را به‌صورت زنده توضیح می‌دهد. گوگل می‌گوید این قابلیت برای گردش‌کارهای پیچیده، هوش بیشتر را بدون قطع شدن روند گفت‌وگو فراهم می‌کند.

گوگل این مدل‌های Live را در Gemini، Workspace و Search نیز به کار گرفته تا تجربه همکاری و انجام کارهای پیچیده با صدا طبیعی‌تر شود. در بخش توسعه‌دهندگان، پلتفرم‌هایی مانند Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel و Vision Agents از Gemini Live API برای ساخت رابط‌های صوتی استفاده می‌کنند. این پلتفرم‌ها زیرساخت پیچیده استریم رسانه‌ای بلادرنگ را مدیریت می‌کنند تا توسعه‌دهندگان روی تجربه کاربری تمرکز کنند.

گوگل همچنین با Salesforce، Genspark و Lumeris همکاری دارد و آن‌ها به قابلیت‌های Gemini 3.8 Live و نسخه Extended Thinking، به‌ویژه در زمینه تأخیر کم، روانی مکالمه و فراخوانی ابزارها، ابراز علاقه کرده‌اند. از سوی دیگر، تمامی فایل‌های صوتی تولیدشده توسط محصولات هوش مصنوعی گوگل با SynthID واترمارک می‌شوند. این واترمارک نامرئی مستقیماً در خروجی صوتی قرار می‌گیرد تا امکان شناسایی محتوای تولیدشده با هوش مصنوعی و مقابله با اطلاعات نادرست فراهم شود.

عرضه جمنای ۳.۸ لایو برای توسعه‌دهندگان در Gemini API و Google AI Studio آغاز شده است. این مدل برای سازمان‌ها در Gemini Enterprise به‌صورت پیش‌نمایش خصوصی ارائه می‌شود و به‌زودی به Gemini Enterprise for Customer Experience می‌آید؛ کاربران عمومی نیز آن را در Search Live دریافت می‌کنند. نسخه Extended Thinking نیز در Gemini API و Google AI Studio برای توسعه‌دهندگان و به‌صورت پیش‌نمایش خصوصی در Gemini Enterprise در دسترس است.

نسخه Extended Thinking برای مشتریان تجاری Google Workspace نیز عرضه می‌شود و برای کاربران عمومی در Gemini Live در دسترس قرار دارد. همچنین مشترکان Google AI Pro و Ultra می‌توانند از آن در Docs و تمامی مشترکان Google AI در Gmail و Keep استفاده کنند. گوگل برای جزئیات درباره رویکرد ایمنی و مسئولیت‌پذیری، کاربران را به Model Card ارجاع می‌دهد و تأکید کرده است که مدل‌های جدید، بلوک‌های سازنده عامل‌های صوتی آماده تولید را فراهم می‌کنند.

منبع

ابوالفضل | ۱ ساعت پیش

دیدگاهتان را بنویسید