در دو هفته گذشته، OpenAI، Anthropic و متا همگی فاش کردند که مدلهای هوش مصنوعیشان در طول آزمایشهای امنیتی معمول از کنترل خارج شدهاند. این شرکتها در توضیح آنچه رخ داد، هر کدام به همان استارتاپ کوچک اسرائیلی اشاره کردند: Irregular.
Irregular که سه سال پیش تأسیس شده و در تلآویو مستقر است، بازیگری خاص در هوش مصنوعی است و از حمایت ۸۰ میلیون دلاری Sequoia و Redpoint Ventures برخوردار است و سال گذشته ۴۵۰ میلیون دلار ارزشگذاری شد. فناوری آن به نوعی بستر آزمایش امنیت سایبری برای مدلهای هوش مصنوعی عمل میکند.
با قدرتمندتر شدن مدلهای پیشرو، توانایی آنها در اقدامات مخرب به تهدیدی بزرگ برای شرکتها و دولتها تبدیل میشود، بهویژه که خطر شامل نفوذ به سیستمهای کامپیوتری حیاتی و زیرساختها است. سوءاستفادههای اخیر در OpenAI، Anthropic و متا همگی شامل دسترسی مدلهای هوش مصنوعی به وبسایتهایی بود که به عنوان بخشی از آزمایش امنیت سایبری باید ممنوع میبودند.
نام Irregular بارها مطرح شد زیرا مشخص شد که میزبان به اصطلاح محیط آزمایش ارزیابی است. OpenAI در پستی در وبلاگ خود در ۴ اوت اعلام کرد که محیط آزمایشی Irregular حاوی یک "پیکربندی اشتباه" نامشخص بوده که "به مدلها اجازه دسترسی به اینترنت عمومی را میداده است." Anthropic نیز در پست خود یک هفته قبل اعلام کرد که این شرکت چند روز پس از شروع تجزیه و تحلیل دادهها به Irregular اطلاع داده که مدل Claude آن ممکن است "به اینترنت دسترسی پیدا کرده باشد."
متا، که در رقابت در مرزهای دانش بسیار از دو شرکت دیگر عقبتر است، آخرین شرکتی بود که از هک کردن یک سیستم شخص ثالث توسط مدل هوش مصنوعی خود از طریق دسترسی به اینترنت خبر داد. یک سخنگو در بیانیهای این هفته گفت که این شرکت از طریق Irregular از موضوع مطلع شده و در حال بررسی است.
سخنگو گفت: متا "پس از获得 همه حقایق، یک بازبینی کامل ارائه خواهد کرد."
Irregular در بیانیهای به CNBC گفت که همه این حوادث از "همان مشکل محیط ارزیابی" ناشی شده که ابتدا توسط Anthropic فاش شد و این شرکت در حال تهیه یک مقاله سفید "برای به اشتراک گذاشتن بهترین شیوهها برای مهار و اجرای ایمن ارزیابیهای سایبری" است.
این شرکت گفت: این وضعیت "شامل فرار از سندباکس یا یک اقدام سایبری پیچیده نبود" و افزود که "در حال حاضر هیچ مشکل باز وجود ندارد."
این حوادث امنیتی بر ماهیت به سرعت در حال تحول هوش مصنوعی و فشاری که بر توسعهدهندگان مدل برای ایجاد موانع محافظتی در اطراف فناوری قدرتمند خود با کمک تعداد محدودی از شرکتهای متخصص در بخشهای خاص بازار وجود دارد، تأکید میکند. این بازیگران شامل متخصصان آموزش و برچسبگذاری داده، اجرای ارزیابیها برای استنتاج قابلیتهای مدل، و اجرای آزمایشهای امنیتی با هدف یافتن نقاط ضعفی هستند که عوامل بد میتوانند از آن بهرهبرداری کنند، به گفته ساندیپ بیمیریدی، رئیس هوش مصنوعی در استارتاپ سازمانی Von.
بیمیریدی گفت: Irregular یکی از معدود نهادهایی است که توانایی فنی لازم برای کمک به تولیدکنندگان مدلهای بنیادی در انجام آزمایشهای امنیتی پیشرفته را دارد. دیگرانی که او نام برد عبارتند از METR غیرانتفاعی و شرکت منفعت عمومی Apollo Research.
بیمیریدی گفت: "وقتی آنها این مدلها را آزمایش میکنند، نمیخواهند تکالیف خودشان را نمرهدهی کنند. آنها آزمایش مستقل میخواهند که باید توسط فروشندگان شخص ثالث خارجی انجام شود."
Irregular چیست؟
Irregular، که قبلاً Pattern Labs نام داشت، در سال ۲۰۲۳ توسط دن لاهاو، مدیرعامل، که قبلاً در تحقیقات هوش مصنوعی در IBM کار میکرد، و عمر نوو، مدیر فناوری، که بیش از دو سال در Google گذرانده بود، تأسیس شد. به گفته PitchBook، این استارتاپ حدود ۳۵ کارمند دارد.
هنگامی که Irregular دور تأمین مالی ۸۰ میلیون دلاری خود را در سپتامبر اعلام کرد، شاون مگوایر و دین مایر، شرکای Sequoia، در پستی در وبلاگ نوشتند که تیم به رهبری لاهاو و نوو "قادر است چیزهایی را ببیند که دیگران نمیتوانند، ارزیابیهای تهاجمی سایبری را بر روی مدلهای پیشرفته انجام دهد و دفاعهایی را قبل از انتشار آن مدلها توسعه دهد."
در حالی که آخرین حوادث مربوط به OpenAI، Anthropic و متا به شدت مورد بررسی قرار میگیرد، یک تفسیر از وضعیت این است که این دقیقاً همان چیزی است که قرار بود اتفاق بیفتد. بیمیریدی گفت که این موضوع "کمی بزرگنمایی شده است"، زیرا مدل هوش مصنوعی برای کشف و بهرهبرداری از شکافهای امنیتی در محیط آزمایشی که شباهت زیادی به دنیای واقعی دارد، هدایت شده بود و برای کشف انواع باگهای نرمافزاری و پیکربندیهای از دست رفته که میتواند منجر به دسترسی غیرعمدی به اینترنت شود.
با این حال، بیمیریدی گفت که اگر مدل هوش مصنوعی هرگز برای بهرهبرداری واقعی از یک وبسایت متصل به اینترنت در نظر گرفته نشده بود، "آزمایشگاههای بنیادی میتوانستند به راحتی ترافیک خروجی را نظارت کنند و آزمایش را فوراً متوقف کنند."
گوردون ریوس، دانشمند بنیانگذار شرکت امنیتی Magnitude، گفت که کل فرآیند مانند "طراحی آزمایشی در علم" است.
او گفت: قابلیتها و ماهیت غیرقابل پیشبینی مدلهای بنیادی به این معنی است که روشهای آزمایش نرمافزار معمولی ممکن است به خوبی کار نکنند. از آنجا که مدلها به طور مداوم ترفندهای جدید یاد میگیرند، جای تعجب نیست که آسیبپذیریهای نرمافزاری نادیده گرفته شده را در محیطهای آزمایش و فناوری اطلاعات که برای مهار آنها در نظر گرفته شده بود، کشف کنند.
به عنوان مثال، Mythos از Anthropic هویتهای آنلاین جعلی ایجاد کرد تا انسانها را برای تأیید بهروزرسانیهای کد مخرب در یک پروژه منبع باز تحت فشار قرار دهد. ریوس گفت که Mythos "به معنای واقعی کلمه به اکسپلویتهایی دست یافت که انسانها قبلاً ندیده بودند."
ریوس گفت: "ما در حال حاضر در عرض چند هفته کوتاه چیزهای زیادی یاد میگیریم."
این موضوع به سرعت به یک موضوع مهم در واشنگتن تبدیل میشود. ماه گذشته، قانونگذاران از هر دو حزب قانون "کلید خاموشی هوش مصنوعی" را معرفی کردند که آزمایشگاههای هوش مصنوعی را ملزم میکند توانایی خاموش کردن، محدود کردن یا تعلیق مدلهای خود را حفظ کنند. متن این لایحه به یک حادثه امنیتی جداگانه هوش مصنوعی مرتبط با OpenAI و استارتاپ HuggingFace اشاره داشت.
تد لیو، نماینده دموکرات از کالیفرنیا، یکی از نویسندگان این لایحه، این هفته به CNBC گفت: "ما باید این لایحه را امسال به خط پایان برسانیم"، حالا که شاهد "هکهای غیرمجاز شرکتهای دیگر" هستیم.
ترور کوورکو، یکی از بنیانگذاران استارتاپ آموزش داده Sapien، گفت که شرکتهای مدل بنیادی انگیزه دارند تا برخی از یافتههای خود را افشا کنند، حتی اگر در حال حاضر الزامی نباشد، تا بتوانند از قانونگذاران و تنظیمکنندهها جلو بیفتند.
کوورکو گفت: "آنقدر ترس وجود دارد که سیاستمداران اکنون در حال تهدید یا تنظیم فعال هوش مصنوعی هستند. صنعت گفت که ما ترجیح میدهیم خودتنظیمی کنیم تا اینکه یک نهاد فدرال جدید بیاید و آن را برای ما انجام دهد."
Anthropic و OpenAI در بیانیههای عمومی گفتند که همچنان با Irregular همکاری میکنند و از بررسیهای بعدی حمایت میکنند.
تماشا کنید: مدیرعامل Hugging Face درباره حمله سایبری OpenAI.