CoreTech

بنچمارک جدید نشان می‌دهد مدل‌های هوش مصنوعی هنوز در دیدن ضعف دارند

ابوالفضل | ۱۶ ساعت پیش

بنچمارک جدید PerceptionBench نشان می‌دهد حتی مدل‌های پیشرفته هوش مصنوعی در یکی از پایه‌ای‌ترین توانایی‌های بصری، یعنی درک دقیق محتوای تصویر، هنوز با مشکل جدی روبه‌رو هستند. در میان ۱۶ مدل پیشرو، GPT-5.6 Sol با دقت ۵۹.۷ درصد بهترین عملکرد را ثبت کرد، اما هیچ مدلی به ۶۰ درصد نرسید. Kimi K3، کلاد فیبل ۵ و جمنای ۳.۱ پرو نیز به‌ترتیب در رتبه‌های بعدی قرار گرفتند.

Moonshot AI، تیم سازنده دستیار چینی Kimi، بنجمارک PerceptionBench را برای سنجش مستقل ادراک بصری مدل‌های زبانی چندوجهی توسعه داده است؛ تفاوت اصلی این معیار با آزمون‌های معمول، جدا کردن دیدن از دانش و استدلال است؛ هر سؤال باید فقط با نگاه کردن به تصویر قابل پاسخ باشد. این بنچمارک ۱۰ حوزه شامل روابط بصری، شمارش، ویژگی‌ها، عمق و سه‌بعدی، مکان‌یابی، مقایسه، تشخیص دقیق، یکپارچه‌سازی زمینه، OCR و توهم‌زایی را بررسی می‌کند.

پژوهشگران این دسته‌بندی‌ها را از روی خطاهای واقعی مدل‌ها ساخته‌اند، نه بر اساس چارچوبی نظری و از پیش تعیین‌شده. آن‌ها ۴۲ بنچمارک متن‌باز را بررسی کردند و دریافتند الگوی خطا میان آزمون‌ها همپوشانی کمی دارد؛ بنابراین هیچ آزمون منفرد یا مجموعه کوچکی نمی‌توانست ضعف‌های ادراکی را پوشش دهد. از میان بیش از ۱۷ هزار سؤال داخلی، ۳ هزار وظیفه منتشر شده و ۶۰ درصد آن‌ها از خطاهای مدل‌ها استخراج شده‌اند.

۴۰ درصد باقی‌مانده وظایف با تصاویر بازطراحی شده‌اند و نمونه‌های آن ساده هستند؛ مانند تعیین جایگاه یک نماد روی صفحه ساعت، شمارش گل‌های داخل جعبه قرمز یا تشخیص تفاوت میان دو جام مداد. در رتبه‌بندی، Kimi K3 با ۵۸.۵ درصد، Claude Fable 5 با ۵۷.۲ درصد و Gemini 3.1 Pro با ۵۶.۲ درصد پس از مدل اول قرار گرفتند و GPT-5.5 نیز امتیاز ۵۵.۸ درصد گرفت.

در زمینه‌ی مدل‌های متن‌باز، Qwen3.5 397B A17B به دقت ۴۷.۵ درصد و GLM-4.6V به ۳۲.۵ درصد رسیدند. بنتایج جزئی از رتبه‌بندی کلی مهم‌ترند، زیرا مدل‌هایی با امتیاز نهایی نزدیک، در مهارت‌های مختلف اختلاف زیادی دارند. توهم‌زایی ضعیف‌ترین حوزه میانگین بود؛ GPT-5.6 Sol در این بخش فقط ۲۶.۹ درصد گرفت، در حالی که Gemini 3.5 Flash با ۵۰.۶ درصد در میان بهترین‌ها قرار داشت.

این آزمون مشخصاً بررسی می‌کند مدل وقتی پاسخ درست صفر است، آیا اشیایی را که در تصویر وجود ندارند، تصور می‌کند یا نه. نویسندگان PerceptionBench همچنین می‌گویند بخشی از خطاهایی که معمولاً به ضعف در استدلال نسبت داده می‌شوند، پیش از آن و هنگام خواندن تصویر رخ می‌دهند. شکستن وظایف چندمرحله‌ای به پرسش‌های ادراکی، امکان شناسایی دقیق مرحله‌ای را فراهم می‌کند که در آن توانایی بصری مدل شکست خورده است.

Moonshot AI پیش‌تر WorldVQA را منتشر کرده بود؛ بنچمارکی که تشخیص اشیا را از استدلال جدا می‌کند. در آن آزمون، بهترین مدل یعنی Gemini 3 Pro تنها ۴۷.۴ درصد امتیاز گرفت و هیچ مدلی از ۵۰ درصد عبور نکرد، همچنین همه مدل‌ها سیستماتیک میزان اطمینان خود به پاسخ‌ها را بیش از حد برآورد کردند. این نتایج نشان می‌دهند ضعف در ادراک بصری در آزمون‌های متفاوت نیز دیده می‌شود.

Kimi K3 در بنچمارک‌های عمومی فاصله خود را با Claude Fable 5 و GPT-5.6 Sol به چند امتیاز کاهش داده، اما در حوزه‌های تخصصی مانند امنیت سایبری تهاجمی و ریاضیات پیچیده همچنان عقب‌تر است. در ادراک بصری، عملکرد آن اکنون هم‌سطح رقبای غربی توصیف شده است. در پژوهشی جداگانه با مشارکت Moonshot AI نیز بنچمارک BabyVision ضعف مدل‌های پیشرو را در وظایف ساده مرتبط با رشد اولیه کودکان نشان داد.

در BabyVision، وظایفی مانند دنبال کردن خطوط و شمارش بلوک‌های پنهان بررسی شد. Gemini 3 Pro در این مجموعه ۴۹.۷ درصد امتیاز گرفت، در حالی که انسان‌ها به ۹۴.۱ درصد رسیدند. پژوهشگران علت این فاصله را گلوگاه کلامی می‌دانند؛ یعنی فرایندی که در آن اطلاعات بصری به زبان تبدیل می‌شود و بخشی از دقت خود را از دست می‌دهد. کد ارزیابی و داده‌های PerceptionBench نیز در GitHub منتشر شده‌اند.

منبع، لینک بنچمارک در GitHub

ابوالفضل | ۱۶ ساعت پیش

دیدگاهتان را بنویسید