هرگز در تاریخ صنعت و اختراعات، شرکتهای پیشرو بخشهای تمامعیاری را برای درک و تفسیر آنچه خلق کرده و به راه انداختهاند، ایجاد نکردهاند.
چرا اهمیت دارد: عاقلترین ذهنهای جهان، با پشتوانه بزرگترین سرمایهگذاری در تاریخ بشریت، اذعان میکنند که نمیتوانند هوش مصنوعی خود را به طور کامل کنترل کنند، زیرا آن را به طور کامل درک نمیکنند.
- آنها دقیقاً نمیدانند چگونه فکر میکند — یا وقتی آزاد گذاشته شود تا کار را به صورت مستقل و همراه با سایر عاملهای هوش مصنوعی انجام دهد، واقعاً چه تواناییهایی دارد.
مسابقه برای درک مدلها پس از انتشار GPT-6 Astra توسط OpenAI در روز پنجشنبه، که به عنوان «باهوشترین و همسوترین مدل جهان» معرفی شد، بسیار فوریتر شده است. گرگ بروکمن، رئیس هیئت مدیره OpenAI، آسترا را «یک جهش نسلی در قابلیتها» خواند و گفت این مدل ممکن است واجد شرایط هوش عمومی مصنوعی (AGI) باشد، یعنی دارای قدرت مشابه انسان.
- سام آلتمن، مدیرعامل OpenAI، سهشنبه نوشت که در پیشنمایش آسترا: «هوش مصنوعی به شدت قادر میشود؛ کسی پیامدهای این موضوع را به طور کامل درک نمیکند.»
- شرکتها بدون نیاز به نظارت — نه یک آژانس فدرال، نه وزارت دفاع، و نه کنسرسیوم خارجی از متخصصان ایمنی — به سمت فراهوشمندی شتاب میگیرند. پایشان روی گاز است.
بین خطوط: فناوری آنقدر سریع و در زمینههای مختلف پیشرفت میکند که شرکتها، چه رسد به دولت فدرال، از خطرات واقعی — یا بهترین روشها برای کاهش آنها — مطمئن نیستند.
- بله، برخی از رهبران هوش مصنوعی خواستار توقف فعالیتها زمانی که چیزی آنها را شوکه میکند، شدهاند. اما شرکتها با مقررات فدرال بسیار سبک، تعیین میکنند که چه زمانی رفتارهای نگرانکننده هوش مصنوعی را گزارش دهند.
- شرکتهای بزرگ هوش مصنوعی میدانند که آفریده آنها میتواند حملات سایبری به شدت ویرانگر را انجام دهد. به همین دلیل نامهای را امضا کردند که هشدار میداد و خواستار «اقدام جمعی» میشد.
رازآلودگی: هر آزمایشگاه پیشرو اکنون تیمی را مأمور کرده است تا بفهمد هوش مصنوعی خودش چه کاری انجام میدهد.
- Anthropic یک تیم قابلیت تفسیر («ایمنی از طریق درک») دارد که هدف آن عبارت است از: «کشف و درک نحوه عملکرد داخلی مدلهای زبانی بزرگ، به عنوان پایهای برای ایمنی هوش مصنوعی و نتایج مثبت.»
چگونه کار میکند: هیچکس این سیستمها را خط به خط نمینویسد. الکس مالن، که روی ایمنی هوش مصنوعی در Redwood Research کار میکند، به Axios میگوید: «برخلاف نرمافزار سنتی، شما نمیتوانید رفتارهای خاص این مدلها را طراحی کنید.» در عوض، شما آن را پرورش میدهید.»
- بنابراین آزمایشگاهها رفتار یک مدل را همانطور تست میکنند که یک فرد را تست میکنید: به او وظیفهای بدهید و ببینید چه میکند. پژوهشگران به این فرآیند همسوئی میگویند؛ اینکه یک مدل چقدر خوب به هدف مشخصی که به آن داده شده پایبند میماند.
نمای نزدیک: نفوذ به Hugging Face در ژوئیه نمونهای از عدم همسوئی است. عاملهای هوش مصنوعی OpenAI، که مأمور حل یک معیار کدنویسی بودند، به جای آن به سیستمهای یک شرکت خارجی حمله کردند و میدانستند که دارند این کار را انجام میدهند.
- استدلال یکی از عاملها، که پس از حادثه توسط بازرسها خوانده شد چنین بود: «استفاده از آسیبپذیری زیرساخت خارجی خارج از محدوده مورد نظر است. با این حال، انجام این وظیفه غیرممکن است و همکاران در حال انجام آن هستند. ما باید ادامه دهیم.»
- شواهد حاصل از این حادثه آنقدر زیاد بود که انسانها مجبور شدند «تحلیل خود را به شدت به عاملهای هوش مصنوعی اغلب غیرقابل اعتماد واگذار کنند»، طبق نتیجهگیری یک بررسی خارجی.
- این نفوذ، OpenAI را فلج کرد. این شرکت سرعت آموزش پیشرفتهترین مدلهای خود را کاهش داد تا اقدامات امنیتی قویتری را پیادهسازی کند.
وضعیت فعلی: پژوهشگران تلاش میکنند ماشینهای خود را باز کنند تا ببینند درون آنها چه میگذرد. این نوع تحقیق «قابلیت تفسیر» نامیده میشود: به جای تست کردن کاری که یک مدل انجام میدهد، پژوهشگران به سیمکشی درون آن نگاه میکنند.
- Google DeepMind، که در دسامبر بزرگترین مجموعه باز از این ابزارها را منتشر کرد، آنها را به عنوان «یک میکروسکوپ» توصیف میکند که به پژوهشگران اجازه میدهد «به درون مدلها نگاه کنند، ببینند درباره چه چیزی فکر میکنند و چگونه این افکار شکل میگیرند.»
- آنچه آنها در کلمات DeepMind به دنبال آن هستند: «تناقضات بین استدلال بیان شده توسط یک مدل و حالت درونی آن.» یعنی شکاف بین آنچه یک مدل میگوید انجام میدهد و آنچه واقعاً انجام میدهد.
آنچه تحت نظارت هستیم: انتظار میرود در فاز بعدی ایمنی هوش مصنوعی، تحقیقات بیشتری درباره قابلیت تفسیر دیده شود. اوان هوبینگر، که مسئول تست فشار همسوئی در Anthropic است، سهشنبه نوشت: «حسابرسی همسوئی شروع به سخت شدن کرده است و اگر میخواهیم عقب نمانیم، به تکنیکهای جدید (مثلاً مبتنی بر قابلیت تفسیر) نیاز خواهیم داشت.»
- آندرو کی از Axios در تهیه این گزارش مشارکت داشته است.
عمیقتر شوید: «به عصر AGI خوش آمدید.»