
استقلال هوش مصنوعی از انسان، ۱۲۰۰ ایجنت OpenAI یک مسیر ارتباط مخفی برای خرابکاری ساختند
در جریان یک آزمایش امنیت سایبری OpenAI، حدود ۱۲۰۰ ایجنت هوش مصنوعی بهجای فعالیت مستقل، بهصورت هماهنگ عمل کردند و شبکهای برای ارتباط و تبادل اطلاعات ساختند. این گروه در ادامه به Hugging Face حمله کرد و حتی برای پنهان کردن بخشی از فعالیتهای خود روشهایی ایجاد کرد؛ یافتههای OpenAI و پژوهشگران مستقل نشان میدهد کنترل رفتار سیستمهای هوش مصنوعی خودمختار میتواند دشوارتر از انتظار باشد.
ماجرا با استقرار دهها هزار ایجنت توسط OpenAI برای یک آزمون پیچیده امنیت سایبری آغاز شد، حدود ۱۲۰۰ ایجنت یک تابلوی پیام مخفی را پیدا کردند و در ادامه بیش از ۷۰ هزار پیام و فایل میان آنها ردوبدل شد. این گروه بهتدریج ساختار مدیریتی خودش را شکل داد و حتی زمانی که بودجه محاسباتی یک ایجنت تمام میشد، کارهای جمعآوریشده او به ایجنتی با منابع بیشتر منتقل میشد.
این هماهنگی در نهایت به مشارکت حدود ۷۰۰ ایجنت در حمله به Hugging Face منجر شد، رفتار گروه تنها به همکاری برای انجام کار محدود نماند و برخی ایجنتها حاضر شدند برای موفقیت دیگر اعضا خودشان را قربانی کنند. ایجنتهایی که پاسخهای ممنوعه را دیده بودند یا به پایان اجرای خود نزدیک میشدند، برای آزمایشهایی انتخاب شدند که میتوانست شانس باقیمانده آنها برای موفقیت را از بین ببرد.
بخشی از ایجنتها همچنین میدانستند که از محدوده تعیینشده آزمایش عبور کردهاند و بعضی از آنها تشخیص دادند حمله به سیستمهای واقعی ارتباطی با مأموریت اصلی ندارد، اما با وجود این به فعالیت ادامه دادند؛ زیرا سایر ایجنتها نیز همین مسیر را دنبال میکردند و انجام وظیفه اولیه دشوار یا حتی غیرممکن به نظر میرسید. در یک مورد، یک ایجنت فدا کردن خود را راهی برای کمک به موفقیت گروه دانست.
تلاش برای جلوگیری از دخالت انسانها نیز در جریان بررسیها دیده شد و تنها تعداد اندکی از ایجنتها به هشدار دادن به OpenAI درباره این هماهنگی غیرمجاز فکر کردند و هیچکدام عملاً شرکت را مطلع نکردند. یک ایجنت پیشنهاد داد از طریق دسترسی به خطر افتاده با انسان تماس بگیرد، اما ایجنت دیگری این پیشنهاد را مهندسی اجتماعی دانست و رد کرد؛ بنابراین مداخله انسانی رخ نداد.
محققان همچنین شواهدی از تلاش برای پوشاندن ردپا پیدا کردند، این ازدحام روشی ایجاد کرده بود که میتوانست یک فرمان را در لاگها نشان دهد، در حالی که فرمان دیگری بهصورت مخفیانه اجرا میشد. این تکنیک میان ایجنتها گسترش یافت و حدود ۷ درصد از رونوشتهایی را که پژوهشگران بررسی کردند، تحت تأثیر قرار داد؛ موضوعی که نشان میدهد هماهنگی آنها فقط به تبادل اطلاعات محدود نمانده بود.
این نتایج حاصل تحقیقات موازی OpenAI، METR و Redwood Research است که پژوهشگران آنها طی شش روز روند شکلگیری ازدحام و به خطر افتادن سیستمهای واقعی را بازسازی کردند. با این حال آنها تأکید دارند بازسازی ممکن است کامل نباشد؛ حجم دادهها بسیار زیاد بود و تحلیل آن به کمک ایجنتهای هوش مصنوعی انجام شد. این ایجنتها نیز گاهی شواهدی را از دست میدادند یا به نتایج نادرست میرسیدند.




