
بنچمارک جدید نشان میدهد مدلهای هوش مصنوعی هنوز در دیدن ضعف دارند
بنچمارک جدید PerceptionBench نشان میدهد حتی مدلهای پیشرفته هوش مصنوعی در یکی از پایهایترین تواناییهای بصری، یعنی درک دقیق محتوای تصویر، هنوز با مشکل جدی روبهرو هستند. در میان ۱۶ مدل پیشرو، GPT-5.6 Sol با دقت ۵۹.۷ درصد بهترین عملکرد را ثبت کرد، اما هیچ مدلی به ۶۰ درصد نرسید. Kimi K3، کلاد فیبل ۵ و جمنای ۳.۱ پرو نیز بهترتیب در رتبههای بعدی قرار گرفتند.
Moonshot AI، تیم سازنده دستیار چینی Kimi، بنجمارک PerceptionBench را برای سنجش مستقل ادراک بصری مدلهای زبانی چندوجهی توسعه داده است؛ تفاوت اصلی این معیار با آزمونهای معمول، جدا کردن دیدن از دانش و استدلال است؛ هر سؤال باید فقط با نگاه کردن به تصویر قابل پاسخ باشد. این بنچمارک ۱۰ حوزه شامل روابط بصری، شمارش، ویژگیها، عمق و سهبعدی، مکانیابی، مقایسه، تشخیص دقیق، یکپارچهسازی زمینه، OCR و توهمزایی را بررسی میکند.

پژوهشگران این دستهبندیها را از روی خطاهای واقعی مدلها ساختهاند، نه بر اساس چارچوبی نظری و از پیش تعیینشده. آنها ۴۲ بنچمارک متنباز را بررسی کردند و دریافتند الگوی خطا میان آزمونها همپوشانی کمی دارد؛ بنابراین هیچ آزمون منفرد یا مجموعه کوچکی نمیتوانست ضعفهای ادراکی را پوشش دهد. از میان بیش از ۱۷ هزار سؤال داخلی، ۳ هزار وظیفه منتشر شده و ۶۰ درصد آنها از خطاهای مدلها استخراج شدهاند.
۴۰ درصد باقیمانده وظایف با تصاویر بازطراحی شدهاند و نمونههای آن ساده هستند؛ مانند تعیین جایگاه یک نماد روی صفحه ساعت، شمارش گلهای داخل جعبه قرمز یا تشخیص تفاوت میان دو جام مداد. در رتبهبندی، Kimi K3 با ۵۸.۵ درصد، Claude Fable 5 با ۵۷.۲ درصد و Gemini 3.1 Pro با ۵۶.۲ درصد پس از مدل اول قرار گرفتند و GPT-5.5 نیز امتیاز ۵۵.۸ درصد گرفت.

در زمینهی مدلهای متنباز، Qwen3.5 397B A17B به دقت ۴۷.۵ درصد و GLM-4.6V به ۳۲.۵ درصد رسیدند. بنتایج جزئی از رتبهبندی کلی مهمترند، زیرا مدلهایی با امتیاز نهایی نزدیک، در مهارتهای مختلف اختلاف زیادی دارند. توهمزایی ضعیفترین حوزه میانگین بود؛ GPT-5.6 Sol در این بخش فقط ۲۶.۹ درصد گرفت، در حالی که Gemini 3.5 Flash با ۵۰.۶ درصد در میان بهترینها قرار داشت.
این آزمون مشخصاً بررسی میکند مدل وقتی پاسخ درست صفر است، آیا اشیایی را که در تصویر وجود ندارند، تصور میکند یا نه. نویسندگان PerceptionBench همچنین میگویند بخشی از خطاهایی که معمولاً به ضعف در استدلال نسبت داده میشوند، پیش از آن و هنگام خواندن تصویر رخ میدهند. شکستن وظایف چندمرحلهای به پرسشهای ادراکی، امکان شناسایی دقیق مرحلهای را فراهم میکند که در آن توانایی بصری مدل شکست خورده است.
Moonshot AI پیشتر WorldVQA را منتشر کرده بود؛ بنچمارکی که تشخیص اشیا را از استدلال جدا میکند. در آن آزمون، بهترین مدل یعنی Gemini 3 Pro تنها ۴۷.۴ درصد امتیاز گرفت و هیچ مدلی از ۵۰ درصد عبور نکرد، همچنین همه مدلها سیستماتیک میزان اطمینان خود به پاسخها را بیش از حد برآورد کردند. این نتایج نشان میدهند ضعف در ادراک بصری در آزمونهای متفاوت نیز دیده میشود.

Kimi K3 در بنچمارکهای عمومی فاصله خود را با Claude Fable 5 و GPT-5.6 Sol به چند امتیاز کاهش داده، اما در حوزههای تخصصی مانند امنیت سایبری تهاجمی و ریاضیات پیچیده همچنان عقبتر است. در ادراک بصری، عملکرد آن اکنون همسطح رقبای غربی توصیف شده است. در پژوهشی جداگانه با مشارکت Moonshot AI نیز بنچمارک BabyVision ضعف مدلهای پیشرو را در وظایف ساده مرتبط با رشد اولیه کودکان نشان داد.
در BabyVision، وظایفی مانند دنبال کردن خطوط و شمارش بلوکهای پنهان بررسی شد. Gemini 3 Pro در این مجموعه ۴۹.۷ درصد امتیاز گرفت، در حالی که انسانها به ۹۴.۱ درصد رسیدند. پژوهشگران علت این فاصله را گلوگاه کلامی میدانند؛ یعنی فرایندی که در آن اطلاعات بصری به زبان تبدیل میشود و بخشی از دقت خود را از دست میدهد. کد ارزیابی و دادههای PerceptionBench نیز در GitHub منتشر شدهاند.




