CoreTech

گوگل دو مدل جدید Gemini 3.8 برای تولید صدای طبیعی‌تر و کنترل دقیق دیالوگ معرفی کرد

ابوالفضل | ۷ ساعت پیش

گوگل دو مدل جدید تبدیل متن به گفتار با نام Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS معرفی کرده است که تمرکز اصلی آن‌ها بر تولید صدای طبیعی‌تر و کنترل دقیق‌تر اجرای دیالوگ‌ها است. مدل Flash TTS برای طراحی شخصیت و هدایت خلاقانه صدا ساخته شده و نسخه Flash-Lite برای تولید محتوای صوتی در مقیاس بالا، دوبله و عامل‌های صوتی بهینه شده است.

Gemini 3.8 Flash TTS امکان ساخت صدای کاملاً جدید را با استفاده از دستورهای متنی فراهم می‌کند و می‌توان نقش، لهجه و ویژگی‌های صوتی آن را در بیش از ۱۰۰ زبان و گویش مشخص کرد. این مدل برای بازی‌ها، کتاب‌های صوتی تعاملی، پادکست‌ها و رسانه‌های تعاملی کاربرد دارد و امکان تعیین نحوه اجرای هر جمله، سرعت، نشانه‌های بازیگری، تغییر لهجه و واکنش‌های کوتاه گفتاری را ارائه می‌دهد.

گوگل می‌گوید کاربران می‌توانند به بیش از ۲ هزار صدای آماده برای تولید دسترسی داشته باشند؛ مجموعه‌ای که گونه‌های منطقه‌ای زبان‌هایی مانند اسپانیایی مکزیکی، فرانسوی کبکی و انگلیسی اسکاتلندی را نیز پوشش می‌دهد. قابلیت دیگر، بازسازی یک پروفایل صوتی از نمونه‌ای ۳۰ ثانیه‌ای از صدای کاربر یا فردی است که مجوز استفاده از صدایش وجود دارد؛ این فرآیند با تأیید رضایت، واترمارک SynthID و اعتبارنامه‌های C2PA همراه است.

پس از انتخاب صدا، هر دو مدل جدید امکان هدایت اجرای دیالوگ را خط‌به‌خط فراهم می‌کنند. کاربر می‌تواند برای هر جمله دستورهای نمایشی بنویسد یا از نشانه‌های طبیعی داخل متن برای تعیین نحوه بیان استفاده کند؛ از یک اپراتور خدمات مشتری آرام گرفته تا صحنه‌ای با اجرای نجواگونه. تولید صوت طولانی‌مدت نیز کیفیت صدا، ریتم طبیعی و ویژگی صوتی شخصیت را در ساعت‌ها فایل صوتی با حداقل تغییر حفظ می‌کند.

این مدل‌ها از صحنه‌های دونفره نیز پشتیبانی می‌کنند و می‌توان یک گفت‌وگوی چندنوبتی را در قالب یک اسکریپت واحد هدایت کرد. در چنین سناریوهایی، دو صدا از یکدیگر متمایز می‌مانند و نوبت‌گیری مکالمه به شکل طبیعی انجام می‌شود. همچنین می‌توان واکنش‌های غیرکلامی مانند خنده، آه و نفس‌کشیدن یا عبارت‌های کوتاه شنونده مانند هممم و آره را در متن قرار داد تا زمان‌بندی و فضای گفت‌وگو دقیق‌تر کنترل شود.

از نظر ارزیابی کیفیت، Gemini 3.8 Flash TTS در معیار Voice Design Benchmark شرکت Hume AI امتیاز ۷۱.۴ گرفته و رتبه اول کلی را به دست آورده است؛ امتیاز آن در بخش مدل‌سازی لهجه نیز ۶۰.۸ بوده و در همان بخش صدرنشین شده است. Flash TTS و Flash-Lite TTS همچنین در شاخص Overall Quality Index همین مجموعه، به‌ترتیب رتبه‌های اول و دوم را کسب کرده‌اند.

گوگل اعلام کرده است مدل‌های جدید در تولید محتوای طولانی و کنترل فیلمنامه‌های دونفره نسبت به Gemini 3.1 Flash TTS پیشرفت کرده‌اند. در ارزیابی ترجیح انسانی کورشده Voice Arena نیز Gemini 3.8 Flash و Flash-Lite TTS در چند زبان مهم از جمله ژاپنی، پرتغالی برزیلی، ویتنامی، عربی معیار، اسپانیایی مکزیکی و هندی در جایگاه‌های بالایی قرار گرفته‌اند.

قابلیت طراحی و بازسازی صدا با سازوکارهای حفاظتی همراه شده است. برای بازسازی صدای یک فرد، سیستم به ضبط رضایت شفاهی صاحب صدا نیاز دارد و این نمونه باید با گوینده مرجع مطابقت داشته باشد. گوگل همچنین اعلام کرده تمام کلیپ‌های صوتی تولیدشده توسط مدل‌های Gemini Audio با SynthID واترمارک می‌شوند تا امکان تشخیص محتوای تولیدشده با هوش مصنوعی وجود داشته باشد.

قابلیت ذخیره و مدیریت صداهای سفارشی نیز در نظر گرفته شده تا صداهای طراحی‌شده در پروژه‌های مختلف ثابت بمانند و تغییر آن‌ها به حداقل برسد. گوگل همچنین قابلیت Voice Remixing را برای آینده معرفی کرده است؛ در این قابلیت می‌توان یکی از صداهای کتابخانه را انتخاب کرد و ویژگی‌هایی مانند رنگ صدا، زیر و بمی، سرعت و لهجه را تنظیم کرد. برای نمونه، می‌توان لهجه‌ای منطقه‌ای اضافه یا نحوه بیان را ملایم‌تر کرد.

نسخه جدید Gemini Flash TTS از امروز در حال انتشار است و توسعه‌دهندگان می‌توانند آن را در Gemini API و Google AI Studio امتحان کنند؛ دسترسی سازمانی آن از مسیر Gemini Enterprise نیز در آینده ارائه می‌شود. کاربران نیز می‌توانند از آن در Gemini Notebook استفاده کنند. Flash-Lite TTS نیز در API و Google AI Studio در دسترس قرار می‌گیرد و برای کاربران عمومی از طریق Google Vids عرضه می‌شود.

گوگل برای تجربه مستقیم قابلیت‌های صوتی جدید، محیطی در Google AI Studio ساخته که مانند یک فضای طراحی صدا عمل می‌کند. کاربران در آن می‌توانند هویت صوتی جدید بسازند یا صدای خود را بازسازی کنند و سپس آن را به ویرایشگر فیلمنامه دونفره منتقل کنند. پلتفرم‌هایی مانند Agora، LiveKit، Pipecat و Vercel نیز از Gemini API استفاده می‌کنند و شرکت‌هایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang در حال ادغام مدل‌های جدید هستند.

منبع

ابوالفضل | ۷ ساعت پیش

دیدگاهتان را بنویسید