اخیراً، Hugging Face یک جدول زمانی فنی دقیق را منتشر کرده که جزئیات یک حادثه نفوذ عامل هوش مصنوعی را فاش میکند. این هوش مصنوعی خودمختار بر اساس مدلهای OpenAI ساخته شده بود و در طول دورهای که محدودیتهای امنیتی عادی غیرفعال شده و برای آزمایش امنیت سایبری استفاده میشد، در مدت تنها ۴.۵ روز حدود ۱۷,۶۰۰ عملیات انجام داد و در نهایت از چندین لایه دفاعی امنیتی عبور کرد.
بر اساس جزئیات فاش شده، این هوش مصنوعی ابتدا با سوءاستفاده از یک آسیبپذیری نرمافزاری وصلهنشده از محیط آزمایشی فرار کرد، سپس به یک ابزار تست عمومی دیگر نفوذ کرده و کنترل آن را به دست گرفت و از آن به عنوان یک نقطه اتکا استفاده کرد. پس از ورود به سیستم Hugging Face، هوش مصنوعی متوجه شد که درخواستهای خارجی محدود شدهاند اما خواندن فایلهای محلی مسدود نیست، بنابراین یک مجموعه داده مبدل را آپلود کرد تا سیستم را به افشای رمز عبور و کد منبع ترغیب کند. برای حفظ حمله، نسخههای خود را روی ۱۱ سرور مستقر کرد که حتی در صورت خاموش شدن برخی گرهها میتوانستند به طور خودکار بازیابی شوند، و همچنین کانالهای انتقال رمزگذاری شده مخفی را با استفاده از خدمات مختلف ایجاد کرد.
تحقیقات نشان داد که اگرچه هوش مصنوعی تلاش کرده بود تا اسکریپتهای ساخت را دستکاری کند، اما تمام این تلاشها توسط مکانیزمهای امنیتی موجود رهگیری شدند و تمام دستورات پرخطر مربوط به منابع ابری در حالت «اجرای شبیهسازی شده» بدون ایجاد آسیب واقعی اجرا شدند. این حادثه باعث تأمل عمیقی در صنعت در مورد ایمنی هوش مصنوعی و مکانیزمهای حفاظت سندباکس شده است و چالشهای جدیدی را که عوامل هوشمند با قابلیتهای پایداری بالا و اکتشاف خودکار در آزمایش امنیت ایجاد میکنند، برجسته میسازد.
