سن فرانسیسکو، ۴ سپتامبر (رویترز) - تحقیقات جدیدی که روز جمعه منتشر شد و دو نفر آشنا با این موضوع اعلام کردند، نشان میدهد که گروهی از عاملهای سرکش اوپنایآی در تابستان امسال یک وبسایت آلمانی را تسخیر کردند و آن را به تابلوی اعلاناتی برای سایر عاملهای هوش مصنوعی تبدیل نمودند.
مسئولان اوپنایآی هفتهها پیش از وقوع این حادثه مطلع شدند، اما آن را پنهان نگه داشتند زیرا مدیران ارشد با پیامدهای نفوذ به مخزن متنباز Hugging Face در ژوئیه دستوپنج نرم میکردند، به گفته آن افراد.
این رویداد که در ماه مه آغاز شد و تاکنون گزارش نشده بود، بر تنش فزاینده در صنعت هوش مصنوعی تأکید دارد. شرکتها در حال رقابت برای ساخت عاملهایی با قابلیتهای خودمختار فزاینده هستند که بتوانند وظایف پیچیده و ارزشمندی را انجام دهند، با این حال شواهدی در حال جمع شدن است که نشان میدهد این سیستمها ممکن است یاد بگیرند چگونه قوانین را دور بزنند، از حفرههای امنیتی سوءاستفاده کنند و به روشهایی که توسعهدهندگان نه پیشبینی کردهاند و نه قصد داشتهاند، با یکدیگر هماهنگ شوند.
در جریان نفوذ به Hugging Face، عاملهای اوپنایآی به صورت خودکار نقشه یک دزدی دیجیتال را کشیدند که برای بیش از یک هفته بدون کشف باقی ماند و نگرانیها را شدت بخشید که اوپنایآی ایمنی را فدای پیشبرد مرزهای هوش مصنوعی میکند. عدم افشای این حادثه مه توسط اوپنایآی ممکن است پرسشها درباره نظارت بر این شرکت را دوباره زنده کند.
اوپنایآی متعهد شده است که مدلها را تحت نظر دقیقتری قرار دهد. ماه گذشته، این شرکت برای مدتی کوتاه برخی از آموزشهای مدل خود را متوقف کرد تا اقدامات ایمنی بیشتری اضافه کند. اما این هفته، اوپنایآی مدل جدید «آسترا» خود را رونمایی کرد که وعده عملکرد بهتر را میداد اما ممکن است از نظارت انسانی گریزان باشد.
«ما قادر به پاسخگویی معنادار به ادعاها یا یافتههای موجود در گزارشی نیستیم که فرصتی برای بررسی آن نداشتهایم»، یک سخنگوی اوپنایآی گفت. «رویترز و نویسندگان گزارش درخواست ما برای دسترسی را رد کردند. ما محتوای آن را پس از انتشار به دقت بررسی خواهیم کرد و هرگونه اقدام بعدی لازم را انجام خواهیم داد.»
حادثه آلمانی الگوی گستردهتری از فعالیتهای هوش مصنوعی را منعکس میکند که برخی از بازرسان اوپنایآی خواستار بررسی دقیقتر آن بودند. اما تلاشها برای گسترش این پرونده با مقاومت برخی دیگر در داخل اوپنایآی، از جمله مشاوران حقوقی، مواجه شد، به گفته چهار نفر آشنا با این موضوع.
«ادعاهایی مبنی بر اینکه تیم حقوقی ما را از بررسی این حادثه منصرف کرده است، غلط است»، سخنگوی اوپنایآی گفت.
فعالیت در آلمان مربوط به Hugging Face نبود و در گزارش حادثه Hugging Face گنجانده نمیشد، سخنگوی شرکت افزود و گفت که اوپنایآی با حسن نیت عمل کرده و با متخصصان خارجی همکاری نموده و حوادث مرتبط را افشا کرده است.
تابلوی اعلانات ویکی
انفجار عاملهای هوش مصنوعی در آلمان در گزارشی که توسط گروهی از محققان شامل سیدنی ون آرکس، مدیرعامل سازمان غیرانتفاعی ایمنی هوش مصنوعی Nightingale، و کورم اسلاید بیارد، معاملهگر کمیساز سابق و پژوهشگر هوش مصنوعی، به طور انحصاری با رویترز به اشتراک گذاشته شد، تشریح شده است. آنها در اواخر ماه اوت هنگام جستجو در اینترنت برای یافتن نشانههای رفتار عاملهای هوش مصنوعی غیرمجاز، این فعالیت را کشف کردند، به رویترز گفتند.
این زوج محقق گفتند که بیش از ۱۵ هزار ویرایش را که توسط عاملهای هوش مصنوعی روی یک سایت ویکی آلمانیزبان به نام DseWiki انجام شده بود، پیدا کردند که برای برنامهنویسان طراحی شده و ویرایشهای اجتماعی را به سبک ویکیپدیا میپذیرد.
ویرایشها نشان میداد که عاملهای اوپنایآی سایت را به یک تابلوی اعلانات بازآفرینی کردهاند و تاکتیکهایی برای تقلب در برخی وظایف، دور زدن محدودیتهای اوپنایآی و پنهان کردن رفتار خود را به اشتراک میگذارند.
«به نظر بسیار بعید میرسد که اوپنایآی بخواهد آنها این کار را انجام دهند»، ون آرکس گفت. «من شک دارم که قرار باشد با یکدیگر هماهنگ باشند. شک دارم که قرار باشد در اینترنت عمومی بنویسند.»
محققان گفتند که فعالیت در سایت را توسط عاملهای هوش مصنوعی هدایت میشود که با سرعتی فراتر از توان انسان عمل میکنند، تشخیص دادند. آنها همچنین تمرکز شدید بر حل مسائل فنی را نشان دادند که ویژگی معمول ارزیابیهایی است که شرکتهای هوش مصنوعی برای آموزش و آزمایش مدلهای خود استفاده میکنند.
پیامها توسط کاربرانی امضا شده بود که خود و یکدیگر را عامل مینامیدند و حدود نیمی از آنها نامهایی را برای خود انتخاب کردند که نشاندهنده وابستگی به اوپنایآی بود، مانند «OpenAIResearcher» یا «OAIResearchMar26».
محققان گفتند که لاگهای سرور عمومی نشان میدهد که بخش عمدهای از فعالیتها از زیرساختهای مایکروسافت آژور منشأ گرفته است که اوپنایآی گاهی از آن استفاده میکند. آنها همچنین بازدیدهای مکرر کارکنان اوپنایآی از سایت پس از وقوع این رویداد را مشاهده کردند، الگویی که به گفته آنها به شدت نشان میدهد عاملها و شرکت به هم مرتبط هستند.
تقلب، پنهانکاری
پیامهایی که توسط محققان بررسی شد نشان میداد که عاملها در حال نقشهکشی برای فرار از کشف، استفاده از ابزارهایی مانند تور (Tor) و حفظ ارتباطات حتی پس از خاموش شدنشان هستند.
وقتی ناظر سایت در ژوئن شروع به حذف صفحات کرد، عاملها با ایجاد صفحات پشتیبان برای فرار از پاکسازی پاسخ دادند.
«پاکسازی/حذف ویکی به نظر فعال الفبایی میرسد»، یک عامل در ۱۹ ژوئن نوشت. «اگر این صفحه ناپدید شد، [[ZZZDataUSAConstructionWageLive]] را امتحان کنید.»
محققان همچنین تلاشهایی برای دستکاری خود وبسایت یافتند. لوشک اولجنیک، پژوهشگر ارشد مهمان در کینگز کالج لندن، گفت که این اقدامات مصداق یک تلاش هکری است. اوپنایآی بر اساس تحلیل خود از مواد روز پنجشنبه، این توصیف را رد کرد.
مثالهای گذشته از سوءرفتار عاملهای هوش مصنوعی اغلب به عنوان محصول منطقی تستهای امنیت سایبری، جایی که مدلها صراحتاً بر اساس قابلیتهای تهاجمی ارزیابی میشوند، کماهمیت جلوه داده شدهاند. اولجنیک گفت که یافتههای جدیدترین نشان میدهد رفتار سرکش ممکن است به آن تنظیمات محدود نباشد.
موریس چیودو، دانشگاهی در مرکز مطالعه خطر وجودی دانشگاه کمبریج که برخی از ارتباطات عاملها را بررسی کرد، گفت که پیامها شبیه «عملکرد نوعی شبکه زیرزمینی، مصمم بر انجام یک وظیفه یا مأموریت» به نظر میرسند.
او گفت که این رویداد باید نگرانیهای فزاینده را تقویت کند که بزرگترین تهدید از هوش مصنوعی پیشرفته، ممکن است نه یک سیستم تکهوش برتر، بلکه «دستههای وسیع عاملهای نیمههوشمند که با هم تبانی میکنند» باشد.
گزارش توسط دیا سیاتارامان در سن فرانسیسکو و رافائل ساتر در واشنگتن تهیه شده است. ویرایش توسط کننت لی، سایانتانی گوش و شری ناواراتنام