
گوگل از قابلیت تحلیل ویدئو با هزینهی ۸۸٪ کمتر، دقت بالاتر و سرعت بهینه رونمایی کرد
گوگل قابلیت تحلیل ویدئویی مبتنی بر عامل را به چند مدل جدید Gemini اضافه کرده است؛ روشی که بهجای بررسی ویدئو با نرخ ثابت، خودش بخشهای مهم را پیدا میکند. به گفته گوگل این تغییر میتواند مصرف توکن و هزینه تحلیل را تا ۸۸ درصد کاهش دهد و در عین حال دقت را بالا ببرد. جمنای ۳.۷ فلش، ۳.۶ فلش و 3.5 Flash-Lite از این قابلیت پشتیبانی میکنند.
مدلهای جدید میتوانند لحظاتی کوتاهتر از یک ثانیه، از جمله تغییر وضعیت یا برشهای سریع را شناسایی کنند؛ جزئیاتی که نمونهبرداری یک فریم در ثانیه ممکن است از دست بدهد. Gemini همچنین میتواند صحنه مشخصی را در میان ساعتها ویدئو پیدا کند، ناهنجاریها را با نمونهبرداری مجدد از بازههای مشکوک و نرخ فریم بالاتر بررسی کند و حرکات تکرارشونده یا اشیای منفرد را در طول زمان بشمارد.

در روش قبلی Gemini ویدئو را بهصورت ایستا و بهطور پیشفرض با نرخ یک فریم در ثانیه تحلیل میکرد و این نرخ از طریق API قابل تنظیم بود. این سیستم از زمان عرضه تحلیل بومی ویدئو در سال ۲۰۲۵، صدای ویدئو را نیز رونویسی و فریمها را بر اساس هر ثانیه بررسی میکرد. حالا مدل خودش انتخاب میکند کدام بخشها، با چه سرعتی و با استفاده از فریم صدا یا متن رونویسیشده بررسی شوند.

گوگل میگوید Gemini اکنون با یک ابزار داخلی فقط بخش مرتبط فایل ویدئویی را دریافت میکند؛ کاری که توسعهدهندگان پیشتر میتوانستند دستی انجام دهند. این رویکرد بر پایه Agentic Vision ساخته شده است؛ قابلیتی که گوگل در ژانویه برای Gemini 3 Flash ارائه کرد تا مدل بتواند با اجرای کد پایتون، تصاویر را بزرگنمایی، برش و حاشیهنویسی کند و در چرخه فکر، عمل و مشاهده بررسی کند؛ هرچند هنگام عرضه در همه موارد خودکار نبود.
مزیت این روش در ویدئوهای طولانی بیشتر دیده میشود؛ از آموزشهای ۱۰ دقیقهای تا سخنرانیهای ۹۰ دقیقهای و ضبطهای چندساعته. در شیوه ایستا توسعهدهندگان باید بین مصرف بالای توکن و روشهایی که جزئیات مهم را حذف میکردند انتخاب میکردند. طبق بنچمارکهای گوگل، از جمله LongVideoBench، جمنای ۳.۷ فلش با تحلیل مبتنی بر عامل بالاترین کیفیت کلی و بهترین توازن میان دقت و هزینه را ارائه میدهد.

این قابلیت اکنون برای ویدئوهای آپلودشده و ویدئوهای یوتیوب از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس است. توسعهدهندگان باید حالت پردازش را در تنظیمات API روی agentic قرار دهند و هزینه را با نرخ استاندارد توکنهای Gemini API بپردازند؛ برای این قابلیت هزینه اضافهای دریافت نمیشود.
گوگل همچنین قصد دارد این قابلیت را به محصولات خود بیاورد و تحلیل ویدئویی مبتنی بر عامل قرار است بهزودی برای همه کاربران اپلیکیشن Gemini روی مدلهای فلش و فلش لایت عرضه شود. طی ماههای آینده، همین فناوری قابلیت Ask YouTube را در صفحه پخش ویدئو نیز تقویت خواهد کرد تا پاسخها ارتباط دقیقتری با محتوایی داشته باشند که واقعاً در ویدئو دیده میشود.




