
گوگل مدل تبدیل گفتار به متن Gemini 3.5 Transcribe را با دقت بالاتر و تأخیر کمتر معرفی کرد
گوگل مدل Gemini 3.5 Transcribe را معرفی کرده است؛ مدلی برای تبدیل گفتار به متن که با تمرکز بر دقت، درک زمینه و پاکسازی طبیعی گفتار توسعه یافته است. این مدل میتواند صدای خام را به متن دقیق و قالببندیشده تبدیل کند و در برابر نویز پسزمینه، اصطلاحات تخصصی، مکثها و اصلاحات حین صحبت عملکرد بهتری داشته باشد، گوگل پیشتر از آن در اپلیکیشن Gemini و اندروید استفاده کرده است.
جمینای ۳.۵ ترنسکرایب برای توسعهدهندگان از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform عرضه شده و در دو مسیر قابل استفاده است. حالت بلادرنگ با Live API و مدل gemini-3.5-transcribe-live، استریم دوطرفه پیوسته با تأخیر کمتر از یک ثانیه ارائه میکند. برای فایلهای از پیش ضبطشده نیز Interactions API و مدل gemini-3.5-transcribe، رونویسی جلسات و تماسها را با تشخیص گوینده و زمانبندی کلمات انجام میدهد.
یکی از قابلیتهای مهم مدل جدید، حفظ ویژگیهای طبیعی گفتار برای درک بهتر منظور کاربر و تشخیص واژگان سفارشی است، Gemini 3.5 Transcribe میتواند اصلاحات حین صحبت، مانند تغییر سهشنبه به چهارشنبه را تشخیص دهد. همچنین از فراخوانی تابع پشتیبانی میکند و در اپلیکیشن Gemini برای macOS میتواند وظایف پیچیدهای مانند تولید تصویر یا تحلیل فایل را از طریق فراخوانی سایر مدلهای Gemini انجام دهد.
بر اساس اندازهگیری Artificial Analysis، نرخ خطای کلمه Gemini 3.5 Transcribe در حالت استریم بهطور میانگین ۴ درصد و در حالت غیر استریم ۲.۶ درصد است. مدل در محیطهای واقعی و پرنویز نیز عملکرد مناسبی دارد و میتواند دادههای ترکیبی از حروف و اعداد، مانند کدهای پستی و شناسه سفارش را با دقت ثبت کند. امکان تعریف واژگان سفارشی نیز به تشخیص اصطلاحات تخصصی و املای خاص کمک میکند.
این مدل بیش از ۸۵ زبان را بهصورت خودکار شناسایی و رونویسی میکند و از لهجههای منطقهای و گویشهای متنوع پشتیبانی دارد. در فایلهای صوتی از پیش ضبطشده، گفتار حداکثر سه نفر با زمانبندی مشخص به گوینده مناسب نسبت داده میشود؛ پشتیبانی از بیش از سه گوینده فعلاً آزمایشی است. گوگل میگوید جمینای ۳.۵ ترنسکرایب در مقایسه با Chirp 3، مدل قبلی، قابلیتهای بیشتری دارد و تأخیر آن نیز کاهش یافته است.
درصد خطای Gemini 3.5 Transcribe در دو حالت مختلف:


طبق دادههای Artificial Analysis، زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰ درصد بهبود یافته است و در بنچمارک FLEURS و مجموعهای از زبانها و مناطق منتخب، Gemini 3.5 Transcribe در حالت استریم به نرخ خطای کلمه ۵.۵۰ درصد و در حالت غیر استریم به ۵.۰۴ درصد رسیده است. گوگل این نتایج را نشانه بهبود عملکرد چندزبانه مدل نسبت به نسل قبلی میداند.
قابلیتهای جمنای ۳.۵ ترنسکرایب به API محدود نمیشود و در محصولات گوگل نیز به کار گرفته شده است، در Gboard، ویژگی Rambler گفتار کاربر را به متن قالببندیشده تبدیل و کلمات پرکننده را حذف میکند؛ کاربر میتواند با صدا متن را ویرایش، غلطهای املایی را اصلاح و سبک نوشتار را تغییر دهد. در Google Antigravity نیز با اجازه کاربر، زمینه صفحه و تاریخچه چت برای دقت بیشتر در نام فایلها و اسناد فعال به کار میرود.
در Google AI Studio جمینای ۳.۵ ترنسکرایب در حالت Build امکان ساخت برنامه با صدای کاربر را فراهم میکند. در اپلیکیشن Gemini برای macOS نیز گفتار طبیعی به متن مرتب تبدیل میشود و فرمانهای صوتی با زمینه صفحه ترکیب میشوند. مدل میتواند با کمک سایر مدلهای Gemini، فایلهای محلی را خلاصه کند، متن را میان برنامهها بازاستفاده کند یا تصویر تولید کند. این قابلیتها بهزودی در کروم برای تایپ صوتی در فیلدهای وب ارائه خواهند شد.
در بخش توسعهدهندگان، پلتفرمهایی مانند Agora، Fishjam، LangChain، LiveKit، Pipecat، Vercel و Vision Agents از Gemini Live API برای ساخت رابطهای صوتی استفاده میکنند. این پلتفرمها زیرساخت پیچیده استریم رسانهای بلادرنگ را مدیریت میکنند تا توسعهدهندگان روی تجربه کاربری تمرکز داشته باشند. شرکتهای Vivo، Intellitek Health و Lingopal نیز بازخورد مثبتی درباره دقت، تأخیر و پشتیبانی زبانی Gemini 3.5 Transcribe ارائه کردهاند.




