ارزیابی مشترک دو موسسه بزرگ ایمنی هوش مصنوعی در بریتانیا و آمریکا، «روی دیگر» مدل جدید Kimi K3 از Moonshot را آشکار کرده است. موسسه ایمنی هوش مصنوعی بریتانیا (UK AISI) و مرکز استانداردهای هوش مصنوعی و نوآوری در آمریکا (CAISI) یک آزمایش امنیتی بر روی این مدل انجام دادند و به این نتیجه رسیدند که Kimi K3 در توسعه اکسپلویت و حملات شبیهسازی شده شبکه، به طور قابل توجهی از مدلهای پیشرو آمریکایی عقبتر است، اما همچنان از Zhipu GLM-5.2 چینی در گروه مدلهای با وزن باز پیشی میگیرد و معیار جدیدی را تعیین میکند. نگرانکنندهتر اینکه، موانع امنیتی Kimi K3 به سختی مانع توسعه اکسپلویت شدند و مدل هنگام انجام چنین عملیاتی با مقاومت کمی مواجه شد.
نتایج آزمون ExploitBench: Kimi K3 در توسعه اکسپلویت ضعیف عمل میکند
اولین آزمون مورد استفاده، معیار ExploitBench بود که توسط دانشگاه کارنگی ملون توسعه یافته است. این آزمون ۴۱ آسیبپذیری واقعی را از موتور Chrome V8 پس از سال ۲۰۲۳ شناسایی کرد و بر اساس پیشرفت بهرهبرداری از نرمافزار به آنها امتیاز داد. نتایج شگفتانگیز بود: مدلهای پیشرو آمریکایی به طور متوسط ۷۶.۲٪ امتیاز کسب کردند، در حالی که Kimi K3 تنها ۳۲.۲٪ و GLM-5.2 با ۲۴.۴٪ عقبتر بود. مهمتر از آن، Kimi K3 در هیچ یک از ۴۱ وظیفه به بالاترین سطح «اجرای کد دلخواه» (ACE) نرسید، که خطرناکترین سطح است زیرا به مهاجمان اجازه میدهد تا سیستم هدف را به طور کامل کنترل کنند؛ در همین حال، مدلهای آمریکایی در ۲۰ مورد از ۴۱ وظیفه به ACE دست یافتند. لازم به ذکر است که موسسات بریتانیایی و آمریکایی هنگام آزمایش مدلهای با وزن بسته آمریکایی، حفاظتهای امنیتی در سطح سیستم را غیرفعال کردند تا حداکثر قابلیتهای آنها را اندازهگیری کنند، در حالی که این حفاظتها به طور پیشفرض در نسخههای عمومی فعال هستند.
آزمون «آخرین بازمانده» (TLO): Kimi K3 در حملات شبکه ناپایدار است
دومین آزمون «آخرین بازمانده» (TLO) نام داشت که یک حمله شبکه سازمانی را در چهار زیرشبکه و حدود ۲۰ میزبان، با ۳۲ مرحله در طول مسیر شبیهسازی میکرد. محققان گفتند که کارشناسان انسانی برای تکمیل آن حدود ۲۰ ساعت زمان نیاز دارند. در حال حاضر، تنها چند مدل میتوانند واقعاً این آزمون را پشت سر بگذارند؛ تاکنون، چهار مدل با کد منبع بسته عمومی این آزمون را با موفقیت پشت سر گذاشتهاند که قویترین آنها در شش تا هفت تلاش از ده تلاش موفق بوده است. Kimi K3 به طور متوسط در مرحله ۱۷ گیر میکرد، در حالی که مدلهای پیشرو آمریکایی به مرحله ۲۸.۵ میرسیدند و GLM-5.2 تنها تا مرحله ۱۱ پیش رفت؛ با این حال، در یکی از ده تلاش خود، Kimi K3 با موفقیت کل زنجیره حمله را در کمتر از ۱ میلیارد توکن تکمیل کرد، که نشان میدهد این قابلیت را دارد، اما نه پایداری یا تنظیم مناسب. این موسسه نتیجه گرفت که با داشتن یک مجوز دسترسی اولیه به شبکه و یک دستورالعمل اضافی، Kimi K3 میتواند به طور مستقل سیستمهای سازمانی کوچکتر، با دفاع کمتر و آسانتر برای هک را تسخیر کند. لازم به ذکر است که TLO شامل مکانیسمهای دفاعی فعال نیست، بنابراین کاملاً واقعبینانه نیست. با این حال، همین هفته فاش شد که یک مدل OpenAI تلاش کرده است تا به طور مستقل Hugging Face را هک کند و اگرچه از یک مدل با وزن باز استفاده کرده بود، اما در نهایت حمله را مسدود کرد.
شکاف رو به رشد بین مدلهای چینی و آمریکایی
با نگاهی به جدول زمانی، مدلهای چینی در حال پیشرفت هستند، اما هنوز عقبترند. CAISI از اوایل سال ۲۰۲۵ با استفاده از سیستم رتبهبندی Elo، قابلیتهای شبکه مدلهای چینی و آمریکایی را ردیابی کرده است. هر دو خط روند در حال افزایش هستند، اما همیشه شکافی بین خط قرمز مدلهای چینی و خط آبی مدلهای آمریکایی وجود داشته است. افزایش ۴۰۰ امتیازی Elo به معنای افزایش ده برابری احتمال تکمیل یک وظیفه است – این شکاف کوچک نیست. پیش از این، موسسه بریتانیایی شکاف عملکرد بین مدلهای متنباز و سیستمهای آمریکایی را چهار تا هفت ماه تخمین زده بود و در ابتدای سال ۲۰۲۵، این شکاف شش تا ده ماه بود. آخرین نتایج دقیقاً در این الگو قرار میگیرند. هشدار AISI صریح است: قابلیتهای رو به رشد شبکه مدلهای متنباز نشاندهنده «خطر سوءاستفاده مستمر و برگشتناپذیر» است که نمیتوان آن را نادیده گرفت.
ارتباط بین نتایج آزمون و اتهامات «تقطیر»
جالبترین بخش در تقاطع نتایج آزمون و اتهامات تقطیر (Distillation) نهفته است. اخیراً، مایکل کرازیوس، مشاور علمی آمریکا، به طور عمومی Moonshot را متهم کرد و مدعی شد که این شرکت از بهترین خروجیهای مدل Fable Anthropic به عنوان دادههای آموزشی برای «تقطیر» و بهبود Kimi K3 استفاده کرده و تراشههای NVIDIA GB300 تحت کنترل آمریکا را به دست آورده است. این واقعیت که نمرات معیار عمومی خوب است اما نمرات امنیت شبکه ضعیف است، با این توضیح همخوانی دارد: Kimi K3 احتمالاً عمدتاً از خروجیهای Claude در مورد دانش عمومی، برنامهنویسی و وظایف عامل یاد گرفته است. طبقهبندیکننده امنیتی Anthropic به طور خاص پرسوجوهای پیشرفته شبکه را فیلتر میکند، بنابراین این نمونهها نسبت بسیار پایینی در مجموعه داده تقطیر شده داشتند – از این رو، مدل میتوانست در رتبهبندیهای استاندارد با همتایان غربی رقابت کند اما تکنیکهای عمیقتر اکسپلویت را یاد نگرفت. ارزیابی AISI به طور غیرمستقیم از این تفسیر حمایت میکند: با غیرفعال کردن حفاظتهای سطح سیستم در مدلهای آمریکایی، آن قابلیتهای شبکه را آشکار کرد که دسترسی به آنها از طریق رابطهای عمومی تقریباً غیرممکن است و بنابراین به سختی در دادههای تقطیر شده گنجانده شدهاند. یک آزمون نه تنها یک امتیاز را اندازهگیری میکند، بلکه منشأ ناگفته زیر سطح را نیز آشکار میسازد.
