
گوگل دو مدل جدید Gemini 3.8 برای تولید صدای طبیعیتر و کنترل دقیق دیالوگ معرفی کرد
گوگل دو مدل جدید تبدیل متن به گفتار با نام Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS معرفی کرده است که تمرکز اصلی آنها بر تولید صدای طبیعیتر و کنترل دقیقتر اجرای دیالوگها است. مدل Flash TTS برای طراحی شخصیت و هدایت خلاقانه صدا ساخته شده و نسخه Flash-Lite برای تولید محتوای صوتی در مقیاس بالا، دوبله و عاملهای صوتی بهینه شده است.
Gemini 3.8 Flash TTS امکان ساخت صدای کاملاً جدید را با استفاده از دستورهای متنی فراهم میکند و میتوان نقش، لهجه و ویژگیهای صوتی آن را در بیش از ۱۰۰ زبان و گویش مشخص کرد. این مدل برای بازیها، کتابهای صوتی تعاملی، پادکستها و رسانههای تعاملی کاربرد دارد و امکان تعیین نحوه اجرای هر جمله، سرعت، نشانههای بازیگری، تغییر لهجه و واکنشهای کوتاه گفتاری را ارائه میدهد.
گوگل میگوید کاربران میتوانند به بیش از ۲ هزار صدای آماده برای تولید دسترسی داشته باشند؛ مجموعهای که گونههای منطقهای زبانهایی مانند اسپانیایی مکزیکی، فرانسوی کبکی و انگلیسی اسکاتلندی را نیز پوشش میدهد. قابلیت دیگر، بازسازی یک پروفایل صوتی از نمونهای ۳۰ ثانیهای از صدای کاربر یا فردی است که مجوز استفاده از صدایش وجود دارد؛ این فرآیند با تأیید رضایت، واترمارک SynthID و اعتبارنامههای C2PA همراه است.
پس از انتخاب صدا، هر دو مدل جدید امکان هدایت اجرای دیالوگ را خطبهخط فراهم میکنند. کاربر میتواند برای هر جمله دستورهای نمایشی بنویسد یا از نشانههای طبیعی داخل متن برای تعیین نحوه بیان استفاده کند؛ از یک اپراتور خدمات مشتری آرام گرفته تا صحنهای با اجرای نجواگونه. تولید صوت طولانیمدت نیز کیفیت صدا، ریتم طبیعی و ویژگی صوتی شخصیت را در ساعتها فایل صوتی با حداقل تغییر حفظ میکند.
این مدلها از صحنههای دونفره نیز پشتیبانی میکنند و میتوان یک گفتوگوی چندنوبتی را در قالب یک اسکریپت واحد هدایت کرد. در چنین سناریوهایی، دو صدا از یکدیگر متمایز میمانند و نوبتگیری مکالمه به شکل طبیعی انجام میشود. همچنین میتوان واکنشهای غیرکلامی مانند خنده، آه و نفسکشیدن یا عبارتهای کوتاه شنونده مانند هممم و آره را در متن قرار داد تا زمانبندی و فضای گفتوگو دقیقتر کنترل شود.

از نظر ارزیابی کیفیت، Gemini 3.8 Flash TTS در معیار Voice Design Benchmark شرکت Hume AI امتیاز ۷۱.۴ گرفته و رتبه اول کلی را به دست آورده است؛ امتیاز آن در بخش مدلسازی لهجه نیز ۶۰.۸ بوده و در همان بخش صدرنشین شده است. Flash TTS و Flash-Lite TTS همچنین در شاخص Overall Quality Index همین مجموعه، بهترتیب رتبههای اول و دوم را کسب کردهاند.
گوگل اعلام کرده است مدلهای جدید در تولید محتوای طولانی و کنترل فیلمنامههای دونفره نسبت به Gemini 3.1 Flash TTS پیشرفت کردهاند. در ارزیابی ترجیح انسانی کورشده Voice Arena نیز Gemini 3.8 Flash و Flash-Lite TTS در چند زبان مهم از جمله ژاپنی، پرتغالی برزیلی، ویتنامی، عربی معیار، اسپانیایی مکزیکی و هندی در جایگاههای بالایی قرار گرفتهاند.
قابلیت طراحی و بازسازی صدا با سازوکارهای حفاظتی همراه شده است. برای بازسازی صدای یک فرد، سیستم به ضبط رضایت شفاهی صاحب صدا نیاز دارد و این نمونه باید با گوینده مرجع مطابقت داشته باشد. گوگل همچنین اعلام کرده تمام کلیپهای صوتی تولیدشده توسط مدلهای Gemini Audio با SynthID واترمارک میشوند تا امکان تشخیص محتوای تولیدشده با هوش مصنوعی وجود داشته باشد.
قابلیت ذخیره و مدیریت صداهای سفارشی نیز در نظر گرفته شده تا صداهای طراحیشده در پروژههای مختلف ثابت بمانند و تغییر آنها به حداقل برسد. گوگل همچنین قابلیت Voice Remixing را برای آینده معرفی کرده است؛ در این قابلیت میتوان یکی از صداهای کتابخانه را انتخاب کرد و ویژگیهایی مانند رنگ صدا، زیر و بمی، سرعت و لهجه را تنظیم کرد. برای نمونه، میتوان لهجهای منطقهای اضافه یا نحوه بیان را ملایمتر کرد.
نسخه جدید Gemini Flash TTS از امروز در حال انتشار است و توسعهدهندگان میتوانند آن را در Gemini API و Google AI Studio امتحان کنند؛ دسترسی سازمانی آن از مسیر Gemini Enterprise نیز در آینده ارائه میشود. کاربران نیز میتوانند از آن در Gemini Notebook استفاده کنند. Flash-Lite TTS نیز در API و Google AI Studio در دسترس قرار میگیرد و برای کاربران عمومی از طریق Google Vids عرضه میشود.
گوگل برای تجربه مستقیم قابلیتهای صوتی جدید، محیطی در Google AI Studio ساخته که مانند یک فضای طراحی صدا عمل میکند. کاربران در آن میتوانند هویت صوتی جدید بسازند یا صدای خود را بازسازی کنند و سپس آن را به ویرایشگر فیلمنامه دونفره منتقل کنند. پلتفرمهایی مانند Agora، LiveKit، Pipecat و Vercel نیز از Gemini API استفاده میکنند و شرکتهایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang در حال ادغام مدلهای جدید هستند.




