CoreTech

گوگل از قابلیت تحلیل ویدئو با هزینه‌ی ۸۸٪ کمتر، دقت بالاتر و سرعت بهینه رونمایی کرد

ابوالفضل | ۶ ساعت پیش

گوگل قابلیت تحلیل ویدئویی مبتنی بر عامل را به چند مدل جدید Gemini اضافه کرده است؛ روشی که به‌جای بررسی ویدئو با نرخ ثابت، خودش بخش‌های مهم را پیدا می‌کند. به گفته گوگل این تغییر می‌تواند مصرف توکن و هزینه تحلیل را تا ۸۸ درصد کاهش دهد و در عین حال دقت را بالا ببرد. جمنای ۳.۷ فلش، ۳.۶ فلش و 3.5 Flash-Lite از این قابلیت پشتیبانی می‌کنند.

مدل‌های جدید می‌توانند لحظاتی کوتاه‌تر از یک ثانیه، از جمله تغییر وضعیت یا برش‌های سریع را شناسایی کنند؛ جزئیاتی که نمونه‌برداری یک فریم در ثانیه ممکن است از دست بدهد. Gemini همچنین می‌تواند صحنه مشخصی را در میان ساعت‌ها ویدئو پیدا کند، ناهنجاری‌ها را با نمونه‌برداری مجدد از بازه‌های مشکوک و نرخ فریم بالاتر بررسی کند و حرکات تکرارشونده یا اشیای منفرد را در طول زمان بشمارد.

در روش قبلی Gemini ویدئو را به‌صورت ایستا و به‌طور پیش‌فرض با نرخ یک فریم در ثانیه تحلیل می‌کرد و این نرخ از طریق API قابل تنظیم بود. این سیستم از زمان عرضه تحلیل بومی ویدئو در سال ۲۰۲۵، صدای ویدئو را نیز رونویسی و فریم‌ها را بر اساس هر ثانیه بررسی می‌کرد. حالا مدل خودش انتخاب می‌کند کدام بخش‌ها، با چه سرعتی و با استفاده از فریم صدا یا متن رونویسی‌شده بررسی شوند.

گوگل می‌گوید Gemini اکنون با یک ابزار داخلی فقط بخش مرتبط فایل ویدئویی را دریافت می‌کند؛ کاری که توسعه‌دهندگان پیش‌تر می‌توانستند دستی انجام دهند. این رویکرد بر پایه Agentic Vision ساخته شده است؛ قابلیتی که گوگل در ژانویه برای Gemini 3 Flash ارائه کرد تا مدل بتواند با اجرای کد پایتون، تصاویر را بزرگ‌نمایی، برش و حاشیه‌نویسی کند و در چرخه فکر، عمل و مشاهده بررسی کند؛ هرچند هنگام عرضه در همه موارد خودکار نبود.

مزیت این روش در ویدئوهای طولانی بیشتر دیده می‌شود؛ از آموزش‌های ۱۰ دقیقه‌ای تا سخنرانی‌های ۹۰ دقیقه‌ای و ضبط‌های چندساعته. در شیوه ایستا توسعه‌دهندگان باید بین مصرف بالای توکن و روش‌هایی که جزئیات مهم را حذف می‌کردند انتخاب می‌کردند. طبق بنچمارک‌های گوگل، از جمله LongVideoBench، جمنای ۳.۷ فلش با تحلیل مبتنی بر عامل بالاترین کیفیت کلی و بهترین توازن میان دقت و هزینه را ارائه می‌دهد.

این قابلیت اکنون برای ویدئوهای آپلودشده و ویدئوهای یوتیوب از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس است. توسعه‌دهندگان باید حالت پردازش را در تنظیمات API روی agentic قرار دهند و هزینه را با نرخ استاندارد توکن‌های Gemini API بپردازند؛ برای این قابلیت هزینه اضافه‌ای دریافت نمی‌شود.

گوگل همچنین قصد دارد این قابلیت را به محصولات خود بیاورد و تحلیل ویدئویی مبتنی بر عامل قرار است به‌زودی برای همه کاربران اپلیکیشن Gemini روی مدل‌های فلش و فلش لایت عرضه شود. طی ماه‌های آینده، همین فناوری قابلیت Ask YouTube را در صفحه پخش ویدئو نیز تقویت خواهد کرد تا پاسخ‌ها ارتباط دقیق‌تری با محتوایی داشته باشند که واقعاً در ویدئو دیده می‌شود.

منبع

ابوالفضل | ۶ ساعت پیش

دیدگاهتان را بنویسید