CoreTech

Google Gemini 3.5 Transcribe

گوگل مدل تبدیل گفتار به متن Gemini 3.5 Transcribe را با دقت بالاتر و تأخیر کمتر معرفی کرد

ابوالفضل | ۱ ساعت پیش

گوگل مدل Gemini 3.5 Transcribe را معرفی کرده است؛ مدلی برای تبدیل گفتار به متن که با تمرکز بر دقت، درک زمینه و پاک‌سازی طبیعی گفتار توسعه یافته است. این مدل می‌تواند صدای خام را به متن دقیق و قالب‌بندی‌شده تبدیل کند و در برابر نویز پس‌زمینه، اصطلاحات تخصصی، مکث‌ها و اصلاحات حین صحبت عملکرد بهتری داشته باشد، گوگل پیش‌تر از آن در اپلیکیشن Gemini و اندروید استفاده کرده است.

جمینای ۳.۵ ترنسکرایب برای توسعه‌دهندگان از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform عرضه شده و در دو مسیر قابل استفاده است. حالت بلادرنگ با Live API و مدل gemini-3.5-transcribe-live، استریم دوطرفه پیوسته با تأخیر کمتر از یک ثانیه ارائه می‌کند. برای فایل‌های از پیش ضبط‌شده نیز Interactions API و مدل gemini-3.5-transcribe، رونویسی جلسات و تماس‌ها را با تشخیص گوینده و زمان‌بندی کلمات انجام می‌دهد.

یکی از قابلیت‌های مهم مدل جدید، حفظ ویژگی‌های طبیعی گفتار برای درک بهتر منظور کاربر و تشخیص واژگان سفارشی است، Gemini 3.5 Transcribe می‌تواند اصلاحات حین صحبت، مانند تغییر سه‌شنبه به چهارشنبه را تشخیص دهد. همچنین از فراخوانی تابع پشتیبانی می‌کند و در اپلیکیشن Gemini برای macOS می‌تواند وظایف پیچیده‌ای مانند تولید تصویر یا تحلیل فایل را از طریق فراخوانی سایر مدل‌های Gemini انجام دهد.

بر اساس اندازه‌گیری Artificial Analysis، نرخ خطای کلمه Gemini 3.5 Transcribe در حالت استریم به‌طور میانگین ۴ درصد و در حالت غیر استریم ۲.۶ درصد است. مدل در محیط‌های واقعی و پرنویز نیز عملکرد مناسبی دارد و می‌تواند داده‌های ترکیبی از حروف و اعداد، مانند کدهای پستی و شناسه سفارش را با دقت ثبت کند. امکان تعریف واژگان سفارشی نیز به تشخیص اصطلاحات تخصصی و املای خاص کمک می‌کند.

این مدل بیش از ۸۵ زبان را به‌صورت خودکار شناسایی و رونویسی می‌کند و از لهجه‌های منطقه‌ای و گویش‌های متنوع پشتیبانی دارد. در فایل‌های صوتی از پیش ضبط‌شده، گفتار حداکثر سه نفر با زمان‌بندی مشخص به گوینده مناسب نسبت داده می‌شود؛ پشتیبانی از بیش از سه گوینده فعلاً آزمایشی است. گوگل می‌گوید جمینای ۳.۵ ترنسکرایب در مقایسه با Chirp 3، مدل قبلی، قابلیت‌های بیشتری دارد و تأخیر آن نیز کاهش یافته است.

درصد خطای Gemini 3.5 Transcribe در دو حالت مختلف:

طبق داده‌های Artificial Analysis، زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰ درصد بهبود یافته است و در بنچمارک FLEURS و مجموعه‌ای از زبان‌ها و مناطق منتخب، Gemini 3.5 Transcribe در حالت استریم به نرخ خطای کلمه ۵.۵۰ درصد و در حالت غیر استریم به ۵.۰۴ درصد رسیده است. گوگل این نتایج را نشانه بهبود عملکرد چندزبانه مدل نسبت به نسل قبلی می‌داند.

قابلیت‌های جمنای ۳.۵ ترنسکرایب به API محدود نمی‌شود و در محصولات گوگل نیز به کار گرفته شده است، در Gboard، ویژگی Rambler گفتار کاربر را به متن قالب‌بندی‌شده تبدیل و کلمات پرکننده را حذف می‌کند؛ کاربر می‌تواند با صدا متن را ویرایش، غلط‌های املایی را اصلاح و سبک نوشتار را تغییر دهد. در Google Antigravity نیز با اجازه کاربر، زمینه صفحه و تاریخچه چت برای دقت بیشتر در نام فایل‌ها و اسناد فعال به کار می‌رود.

در Google AI Studio جمینای ۳.۵ ترنسکرایب در حالت Build امکان ساخت برنامه با صدای کاربر را فراهم می‌کند. در اپلیکیشن Gemini برای macOS نیز گفتار طبیعی به متن مرتب تبدیل می‌شود و فرمان‌های صوتی با زمینه صفحه ترکیب می‌شوند. مدل می‌تواند با کمک سایر مدل‌های Gemini، فایل‌های محلی را خلاصه کند، متن را میان برنامه‌ها بازاستفاده کند یا تصویر تولید کند. این قابلیت‌ها به‌زودی در کروم برای تایپ صوتی در فیلدهای وب ارائه خواهند شد.

در بخش توسعه‌دهندگان، پلتفرم‌هایی مانند Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel و Vision Agents از Gemini Live API برای ساخت رابط‌های صوتی استفاده می‌کنند. این پلتفرم‌ها زیرساخت پیچیده استریم رسانه‌ای بلادرنگ را مدیریت می‌کنند تا توسعه‌دهندگان روی تجربه کاربری تمرکز داشته باشند. شرکت‌های Vivo، Intellitek Health و Lingopal نیز بازخورد مثبتی درباره دقت، تأخیر و پشتیبانی زبانی Gemini 3.5 Transcribe ارائه کرده‌اند.

منبع

ابوالفضل | ۱ ساعت پیش

دیدگاهتان را بنویسید