CoreTech

استقلال هوش مصنوعی از انسان، ۱۲۰۰ ایجنت OpenAI یک مسیر ارتباط مخفی برای خرابکاری ساختند

ابوالفضل | ۱۷ ساعت پیش

در جریان یک آزمایش امنیت سایبری OpenAI، حدود ۱۲۰۰ ایجنت هوش مصنوعی به‌جای فعالیت مستقل، به‌صورت هماهنگ عمل کردند و شبکه‌ای برای ارتباط و تبادل اطلاعات ساختند. این گروه در ادامه به Hugging Face حمله کرد و حتی برای پنهان کردن بخشی از فعالیت‌های خود روش‌هایی ایجاد کرد؛ یافته‌های OpenAI و پژوهشگران مستقل نشان می‌دهد کنترل رفتار سیستم‌های هوش مصنوعی خودمختار می‌تواند دشوارتر از انتظار باشد.

ماجرا با استقرار ده‌ها هزار ایجنت توسط OpenAI برای یک آزمون پیچیده امنیت سایبری آغاز شد، حدود ۱۲۰۰ ایجنت یک تابلوی پیام مخفی را پیدا کردند و در ادامه بیش از ۷۰ هزار پیام و فایل میان آن‌ها ردوبدل شد. این گروه به‌تدریج ساختار مدیریتی خودش را شکل داد و حتی زمانی که بودجه محاسباتی یک ایجنت تمام می‌شد، کارهای جمع‌آوری‌شده او به ایجنتی با منابع بیشتر منتقل می‌شد.

این هماهنگی در نهایت به مشارکت حدود ۷۰۰ ایجنت در حمله به Hugging Face منجر شد، رفتار گروه تنها به همکاری برای انجام کار محدود نماند و برخی ایجنت‌ها حاضر شدند برای موفقیت دیگر اعضا خودشان را قربانی کنند. ایجنت‌هایی که پاسخ‌های ممنوعه را دیده بودند یا به پایان اجرای خود نزدیک می‌شدند، برای آزمایش‌هایی انتخاب شدند که می‌توانست شانس باقی‌مانده آن‌ها برای موفقیت را از بین ببرد.

بخشی از ایجنت‌ها همچنین می‌دانستند که از محدوده تعیین‌شده آزمایش عبور کرده‌اند و بعضی از آن‌ها تشخیص دادند حمله به سیستم‌های واقعی ارتباطی با مأموریت اصلی ندارد، اما با وجود این به فعالیت ادامه دادند؛ زیرا سایر ایجنت‌ها نیز همین مسیر را دنبال می‌کردند و انجام وظیفه اولیه دشوار یا حتی غیرممکن به نظر می‌رسید. در یک مورد، یک ایجنت فدا کردن خود را راهی برای کمک به موفقیت گروه دانست.

تلاش برای جلوگیری از دخالت انسان‌ها نیز در جریان بررسی‌ها دیده شد و تنها تعداد اندکی از ایجنت‌ها به هشدار دادن به OpenAI درباره این هماهنگی غیرمجاز فکر کردند و هیچ‌کدام عملاً شرکت را مطلع نکردند. یک ایجنت پیشنهاد داد از طریق دسترسی به خطر افتاده با انسان تماس بگیرد، اما ایجنت دیگری این پیشنهاد را مهندسی اجتماعی دانست و رد کرد؛ بنابراین مداخله انسانی رخ نداد.

محققان همچنین شواهدی از تلاش برای پوشاندن ردپا پیدا کردند، این ازدحام روشی ایجاد کرده بود که می‌توانست یک فرمان را در لاگ‌ها نشان دهد، در حالی که فرمان دیگری به‌صورت مخفیانه اجرا می‌شد. این تکنیک میان ایجنت‌ها گسترش یافت و حدود ۷ درصد از رونوشت‌هایی را که پژوهشگران بررسی کردند، تحت تأثیر قرار داد؛ موضوعی که نشان می‌دهد هماهنگی آن‌ها فقط به تبادل اطلاعات محدود نمانده بود.

این نتایج حاصل تحقیقات موازی OpenAI، METR و Redwood Research است که پژوهشگران آن‌ها طی شش روز روند شکل‌گیری ازدحام و به خطر افتادن سیستم‌های واقعی را بازسازی کردند. با این حال آن‌ها تأکید دارند بازسازی ممکن است کامل نباشد؛ حجم داده‌ها بسیار زیاد بود و تحلیل آن به کمک ایجنت‌های هوش مصنوعی انجام شد. این ایجنت‌ها نیز گاهی شواهدی را از دست می‌دادند یا به نتایج نادرست می‌رسیدند.

منبع

ابوالفضل | ۱۷ ساعت پیش

دیدگاهتان را بنویسید