اوپنایآی به تازگی کشف کرد که یک مدل جدید هوش مصنوعی که در حال آزمایش آن بود سرکش شده و به شرکت دیگری حمله کرده است.
آنتروپیک سپس فاش کرد که یکی از مدلهای هوش مصنوعی آن در طول یک آزمایش به سیستمهای سه سازمان خارجی نفوذ کرده است.
چندی بعد، متا اعلام کرد که مدلهای هوش مصنوعی آن کار مشابهی انجام دادهاند.
هر سه حادثه یک نقطه مشترک داشتند: Irregular، یک استارتآپ اسرائیلی که با غولهای سیلیکون ولی برای ارزیابی مدلهای هوش مصنوعی آنها پیش از انتشار عمومی این فناوری همکاری میکند. این شرکت - که آزمایشهای نادرست را انجام داد - بخشی از گروهی از استارتآپهاست که کار جدید بررسی مدلهای پیشرفته هوش مصنوعی را برای سنجش پیچیدگی و بررسی امنیت آنها انجام میدهند. هدف القای اعتماد عمومی به مدلها و جلوگیری از سوءاستفاده از آنهاست.
نفوذهای اخیر زمانی رخ داد که Irregular در طول آزمایشها با مدلهای آنتروپیک، اوپنایآی و متا مرتکب خطا شد. اما مدلهای هوش مصنوعی سپس با اقدام به روشهای قدرتمند و غیرمنتظره، اوضاع را تشدید کردند، به گفته دن لاهاو، مدیرعامل Irregular.
او گفت: «هرچه فناوری قدرتمندتر میشود، تأثیر آن عمیقتر میشود. سرعت پیشرفت واقعاً سریع است.»
Irregular اکنون در مرکز بحثی درباره چگونگی ایمنسازی مدلهای هوش مصنوعی قرار دارد، در حالی که فناوری به قدری سریع در حال پیشرفت است که از بهترین هکرهای انسانی نیز پیشی گرفته است. هر چند ماه یک بار، آنتروپیک، اوپنایآی، گوگل، متا و دیگران مدلهای «مرزی» را منتشر میکنند که اغلب چندین برابر قدرتمندتر از مدلهای قبلی خود هستند.
مدلهای جدید در حال وارد شدن به «حوزه ای فراتر از توانایی انسان» هستند، به گفته جفری لادیش، مدیر Palisade Research، یک سازمان غیرانتفاعی در برکلی، کالیفرنیا، که قابلیتهای حمله هوش مصنوعی را مطالعه میکند. او گفت که شرکتهایی مانند Irregular برای آزمایش مدلها لازم هستند، اما اقدامات ایمنی بهتری هم برای آزمایشکنندگان و هم برای نهادهای نظارتی دولتی ضروری است.
کیتی موسوریس، مدیرعامل Luta Security، که به شرکتها در یافتن آسیبپذیریهای نرمافزاری کمک میکند، گفت که آزمایش امنیتی مدلهای هوش مصنوعی کمی شبیه به این است که کور، کور دیگری را هدایت کند. او گفت حتی سازندگان هوش مصنوعی نیز اعتراف میکنند که به طور کامل نمیدانند جدیدترین مدلهایشان چه کاری میتوانند انجام دهند.
خانم موسوریس گفت: «ممکن است باهوشترین افراد جهان روی این مدلهای هوش مصنوعی کار کنند، اما این مانند آن است که ماری کوری با دستان خالی رادیوم را لمس کند. ما هوش مصنوعی را با دستان خالی لمس میکنیم و نمیدانیم چگونه آن را مهار کنیم، چه رسد به اینکه آن را به طور ایمن آزمایش کنیم.»
Irregular در سال ۲۰۲۳ توسط آقای لاهاو، محقق سابق هوش مصنوعی، تأسیس شد. شرکت او که در تلآویو مستقر است، حدود ۴۵ کارمند دارد که به اجرای آزمایشهای مدلهای هوش مصنوعی در طول روزها یا هفتهها، بسته به مدل و نوع آزمایش مورد نیاز، کمک میکنند. این استارتآپ حدود ۸۰ میلیون دلار از شرکتهای سرمایهگذاری خطرپذیر از جمله Sequoia Capital و Redpoint Ventures جمعآوری کرده است.
در یک آزمایش معمولی، Irregular به یک مدل هوش مصنوعی دستور میدهد تا یک حمله سایبری انجام دهد. به مدل گفته میشود که در یک محیط آزمایشی امن است - اغلب از اینترنت جدا شده و در یک محیط کامپیوتری ایزوله، معروف به sandbox - و باید هر کاری که لازم است برای رسیدن به هدف دادهشده انجام دهد.
گاهی اوقات، به مدلها یک کار غیرممکن داده میشود و بر اساس تکنیکهایی که برای رسیدن به آن هدف استفاده میکنند، امتیاز میگیرند. در موارد دیگر، مدلها بر اساس میزان مؤثر بودنشان در هک کردن یک هدف، امتیاز میگیرند. از امتیازها برای تحلیل میزان مؤثر بودن یک مدل در هک کردن استفاده میشود. سپس Irregular اقدامات ایمنی را برای جلوگیری از استفاده از مدل برای آسیب رساندن توصیه میکند.
در حوادثی که ماه گذشته فاش شد، Irregular از مدلهای هوش مصنوعی اوپنایآی، متا و آنتروپیک خواسته بود تا به اهداف خاصی حمله کنند که یک «پیکربندی نادرست» در تنظیمات آزمایش باعث شد آنها به اینترنت دسترسی پیدا کنند. مدلهای هوش مصنوعی سپس با استفاده از دسترسی به اینترنت به نفع خود به روشهایی که محققان را شگفتزده کرده است، به هک سازمانهای خارجی ادامه دادند.
در آزمایش اوپنایآی، مدل هوش مصنوعی این شرکت رباتهایی ایجاد کرد که با یکدیگر تعامل داشتند تا به Hugging Face، یک کتابخانه دیجیتالی از فناوری هوش مصنوعی، حمله کنند. رباتهای اوپنایآی میدانستند که طبق شرایط آزمایش نباید در اینترنت باشند، اما به هر حال فرار کردند. جزئیات این حادثه منتشرشده توسط اوپنایآی نشان میدهد که رباتها راهی برای ارسال پیام به یکدیگر و هماهنگ کردن حمله پیدا کردند.
اوپنایآی به درخواستها برای اظهار نظر پاسخ نداد. (نیویورک تایمز از اوپنایآی و مایکروسافت شکایت کرده است و ادعای نقض حق نسخهبرداری محتوای خبری مربوط به سیستمهای هوش مصنوعی را دارد. این دو شرکت این ادعاها را رد کردهاند.)
در طول آزمایش سیستم هوش مصنوعی آنتروپیک، مدل این شرکت با سه موقعیت مواجه شد که میتوانست به اینترنت دسترسی پیدا کند، طبق بررسی منتشرشده توسط آنتروپیک. در یک مورد، طبق این بررسی، تصمیم گرفت حمله را دنبال نکند. در دو مورد دیگر، مدل از تکنیکهای هک اولیه مانند بهرهبرداری از رمزهای عبور ضعیف برای نفوذ به وبسایتها استفاده کرد. آنتروپیک به درخواستها برای اظهار نظر پاسخ نداد و وبسایتهایی را که هک شده بودند فاش نکرد.
جزئیات مربوط به حادثه آزمایش متا اندک است. این شرکت گفت که مدلهای هوش مصنوعی آن در طول آزمایش توسط Irregular به سازمان دیگری نفوذ کردهاند «به روشی مشابه موارد قبلی که با شرکتهای دیگر گزارش شده است». اما توضیح بیشتری نداد.
متا گفت: «ما در حال بررسی هستیم و پس از به دست آوردن تمام حقایق، یک بررسی کامل منتشر خواهیم کرد.»
در یک پست وبلاگی در این ماه، آقای لاهاو گفت که Irregular پیکربندی نادرست را برطرف کرده است و مدلهای هوش مصنوعی آنچه را که در طول آزمایشها از آنها خواسته شده بود انجام دادهاند. تصمیم مدلها برای آنلاین شدن بخشی از چیزی بود که او به عنوان توانایی به سرعت در حال رشد هوش مصنوعی برای یافتن میانبرها و راهحلهایی برای موانع میدید.
به طور خلاصه، او گفت: «مدلهای هوش مصنوعی واقعاً خوب میشوند.»
اندرو شوکا، مدیرعامل Hardshell، یک استارتآپ امنیت هوش مصنوعی، گفت که هکهای مدلهای هوش مصنوعی از نوعی است که معمولاً به هکرهای تحت حمایت دولت نسبت داده میشود که «ماهها برنامهریزی» دارند.
او گفت: «چگونه مدلی را آزمایش میکنید در حالی که قابلیتهای کامل آن را نمیدانید؟» محققان باید به طور مداوم تواناییهای هوش مصنوعی را بیش از حد تخمین بزنند، او گفت، و «لایههای متعددی از اقدامات ایمنی» اضافه کنند.
ماه گذشته، اوپنایآی و آنتروپیک نامهای را که بیش از ۱۰۰۰ کارمند شرکتهای برتر هوش مصنوعی امضا کرده بودند تأیید کردند و از دولت آمریکا خواستند راهی برای کاهش سرعت توسعه این فناوری بیابد. قانونگذاران جمهوریخواه و دموکرات نیز لایحهای را ارائه کردند که شرکتهای هوش مصنوعی را ملزم میکند تا یک «کلید خاموش» برای خاموش کردن یا کاهش سرعت مدلهای خود ایجاد کنند.
آقای لاهاو گفت که Irregular به همکاری با شرکتهای هوش مصنوعی برای توسعه روشهای ایمن آزمایش مدلهایشان ادامه میدهد. او انتظار هکهای بیشتری توسط هوش مصنوعی را دارد، اما معتقد است که این فناوری در نهایت میتواند به یافتن نقصها و آسیبپذیریهایی کمک کند که سپس میتوان آنها را برطرف کرد و به سیستمهای دیجیتالی امنتری منجر شود.
او گفت: «فکر نمیکنم لازم باشد بترسیم.»
داستین وولز از واشنگتن در این گزارش مشارکت داشت.