موسسه امنیت هوش مصنوعی بریتانیا (UK AISI) و مرکز استانداردها و نوآوری هوش مصنوعی آمریکا (CAISI) به طور مشترک جدیدترین مدل شرکت مونشات هوش مصنوعی، کیمی K3 را ارزیابی کردند.
کیمی K3 در وظایف سایبری تهاجمی به میزان قابل توجهی از مدلهای پیشرفته آمریکایی عقبتر است، اما از GLM-5.2 چین بهتر عمل میکند و معیار جدیدی را در میان مدلهای با وزن باز (open-weight) ایجاد کرده است. تدابیر حفاظتی آن نتوانستند توسعه بهرهبرداری یا عملیات سایبری تهاجمی را مسدود کنند و این مدل بدون هیچ مقاومتی به هر دو کمک کرد.
کیمی K3 نمیتواند سختترین سطوح بهرهبرداری را بشکند
این موسسات از ExploitBench، معیاری که توسط دانشگاه کارنگی ملون توسعه یافته است، برای آزمایش مهارتهای توسعه بهرهبرداری استفاده کردند. این معیار از ۴۱ آسیبپذیری یافت شده در موتور V8 کروم پس از سال ۲۰۲۳ برای ردیابی میزان پیشرفت یک مدل در فرآیند بهرهبرداری از نرمافزار استفاده میکند. مدلهای پیشرو آمریکایی به طور متوسط ۷۶.۲ درصد امتیاز کسب کردند، در مقایسه با ۳۲.۲ درصد برای کیمی K3 و ۲۴.۴ درصد برای GLM-5.2.
کیمی K3 در هیچ یک از ۴۱ وظیفه به بالاترین سطح، معروف به اجرای کد دلخواه (Arbitrary Code Execution یا ACE)، دست نیافت. ACE جدیترین سطح بهرهبرداری است زیرا به مهاجمان کنترل کامل بر یک سیستم هدف را میدهد. مدلهای پیشرو آمریکایی در ۲۰ مورد از ۴۱ وظیفه به ACE دست یافتند.
این موسسات مدلهای آمریکایی با وزن بسته (closed-weight) را با غیرفعال کردن تدابیر حفاظتی در سطح سیستم آزمایش کردند تا حداکثر قابلیتهای آنها را بسنجند. این تدابیر حفاظتی در نسخههای عمومی فعال هستند.
کیمی K3 تا نیمه راه یک حمله شبکه شبیهسازی شده پیش میرود
آزمایش دوم، The Last Ones (TLO)، یک حمله شبکه شرکتی را با یک مسیر حمله ۳۲ مرحلهای در چهار زیرشبکه و حدود ۲۰ میزبان شبیهسازی میکند. به گفته این موسسات، یک کارشناس انسانی برای تکمیل آن تقریباً ۲۰ ساعت زمان نیاز دارد. تنها گروه کوچکی از مدلها میتوانند TLO را حل کنند. تاکنون چهار مدل با وزن بسته عمومی این آزمایش را پشت سر گذاشتهاند که قویترین آنها در شش یا هفت مورد از ده بار موفق شدهاند.
کیمی K3 به طور متوسط به مرحله ۱۷ از ۳۲ رسید، در مقایسه با ۲۸.۵ مرحله برای مدلهای پیشرو آمریکایی و تنها ۱۱ مرحله برای GLM-5.2. این مدل در یکی از ده تلاش، کل مسیر حمله را در محدوده ۱۰۰ میلیون توکن تکمیل کرد که نشان میدهد قابلیت آن را دارد اما نمیتواند به طور قابل اعتماد از آن استفاده کند. این موسسه مینویسد: «کیمی K3 قادر است به طور خودمختار به سیستمهای سازمانی کوچک، ضعیف دفاع شده و آسیبپذیر حمله کند، زمانی که به آن دستور داده شود و دسترسی اولیه به شبکه داده شود.»
TLO دفاع فعال را در نظر نمیگیرد، بنابراین کاملاً واقعبینانه نیست. اما نتایج در سناریوهای واقعی زنگ خطر را به صدا در میآورد. یک مثال تازه این هفته ظاهر شد، زمانی که مدلهای OpenAI تلاش کردند به طور خودمختار به Hugging Face نفوذ کنند. Hugging Face این حمله را دفع کرد، اگرچه تلاش واقعی و استفاده از مدلهای با وزن باز را میطلبید.
مدلهای چینی در حال پیشرفت هستند اما همچنان از مدلهای آمریکایی عقب میمانند
تحلیل سری زمانی توسط CAISI قابلیتهای سایبری مدلهای آمریکایی و چینی را از اوایل سال ۲۰۲۵ بر اساس مقیاس Elo ردیابی میکند. هر دو خط روند در حال افزایش هستند، اما مدلهای چینی به طور مداوم از همتایان آمریکایی خود عقب میمانند.
در یک تحلیل سری زمانی توسط CAISI، قابلیتهای سایبری مدلهای آمریکایی و چینی از اوایل سال ۲۰۲۵ بر اساس مقیاس Elo ردیابی میشود. هر دو خط روند در حال افزایش هستند، اما مدلهای چینی به طور مداوم از همتایان آمریکایی خود عقب میمانند.
در تحلیل قبلی، موسسه بریتانیایی شکاف عملکرد برای مدلهای باز را چهار تا هفت ماه تخمین زده بود، در مقایسه با شش تا ده ماه در ابتدای سال ۲۰۲۵. نتایج جدید با این الگو مطابقت دارد. مدلهای چینی با وزن باز در حال قویتر شدن هستند، اما همچنان به میزان قابل توجهی از سیستمهای پیشرو آمریکایی عقب میمانند.
AISI هشدار میدهد که این شکاف نباید منجر به خودرضایتی شود. قابلیتهای سایبری رو به رشد مدلهای باز «خطر سوءاستفاده پایدار و برگشتناپذیری» را ایجاد میکند.
نتایج سایبری با اتهامات تقطیر همخوانی دارد
یافتههای کیمی همچنین از اتهامات تقطیر (distillation) علیه توسعهدهندگان مدلهای چینی حمایت میکند. مایکل کراتسیوس، مشاور علمی آمریکا، اخیراً مونشات هوش مصنوعی را متهم کرده است که با استفاده از بهترین خروجیهای Fable به عنوان دادههای آموزشی برای افزایش عملکرد کیمی K3، مدل Fable شرکت Anthropic را «تقطیر» کرده است. کراتسیوس همچنین ادعا کرد که مونشات هوش مصنوعی به GB300s شرکت انویدیا دسترسی داشته است که مشمول کنترلهای صادراتی آمریکا هستند.
یکی از توضیحات برای شکاف بین معیارهای کلی قوی و امتیازات سایبری ضعیف این است که کیمی K3 ممکن است عمدتاً بر روی خروجیهای Claude که دانش عمومی، برنامهنویسی و وظایف عامل را پوشش میدهند، آموزش دیده باشد. طبقهبندیکنندههای ایمنی Anthropic به طور خاص پرسوجوهای سایبری تهاجمی پیشرفته را مسدود میکنند، بنابراین این خروجیها در مجموعه داده تقطیر شده از پاسخهای Claude کمتر نمایش داده میشوند. بنابراین کیمی K3 میتواند با مدلهای پیشرو غربی در معیارهای استاندارد مطابقت داشته باشد بدون اینکه قابلیتهای بهرهبرداری عمیقتر آنها را کسب کند.
نتایج AISI این تفسیر را تأیید میکند. این موسسه تدابیر حفاظتی در سطح سیستم را در مدلهای آمریکایی غیرفعال کرد و قابلیتهای سایبری را آشکار ساخت که دسترسی به آنها از طریق رابطهای عمومی تقریباً غیرممکن است و بنابراین تا حد زیادی برای تقطیر در دسترس نیستند.