آنچه اکنون میخواهم بگویم، همانطور که خودم نیز آگاهم، به نوعی کلیشه شده است: من این هفته از اوپنایآی استعفا دادم. من مسئول نوشتن گزارشهای ایمنی بودم که با هر راهاندازی اصلی منتشر میکردیم. اکنون من به صف طولانی همکاران سابقم—در اوپنایآی و سایر رهبران این صنعت—میپیوندم که تصمیم گرفتهاند مسیر فعلی غیرقابل قبول است.
من با سایر کارکنانی که اخیراً جدا شدهاند موافقم که شرکتهای سازنده این فناوری به اندازه کافی محتاط نیستند. اما من معتقدم ما باید فراتر از قوانین خاص یا قوانین جدید نگاه کنیم. ما باید درباره فرهنگ صحبت کنیم.
آینده به خردی بستگی دارد که سیلیکونولی فاقد آن است. خرد در مورد نحوه مدیریت فناوری خطرناک و بنیادیتر، خرد در مورد معنای اهمیت دادن به مردم. این لحظه نیازمند سطحی از فروتنی است که برای افرادی که از طریق اعتمادبهنفس افراطی خود موفق شدهاند، طبیعی نیست. همکاران سابق من در اوپنایآی دوراندیش بودند: آنها قوانین مقیاسپذیری را درک کردند که به معنای هوشمندتر بودن سیستمهای بزرگتر هوش مصنوعی بود—بنابراین آنها با هزینه زیاد، تمام تلاش خود را برای ساخت سیستمهای بزرگتر متمرکز کردند. نگرش «ما میتوانیم» برای دستیابی به امور ظاهراً ناممکن—همراه با زمانبندیهای کاری که به اسپرینتهای دائمی تبدیل شدهاند—در سراسر صنعت رایج است.
رویکرد ایمنی که از چنین فرهنگی سرچشمه میگیرد، با خوشبینی بیقیدوشرط نسبت به توانایی حل مشکلات هنگام بروز آنها آغاز میشود. اوپنایآی با آزمون و خطا (که آن را «استقرار تکراری» مینامد) رشد کرده است؛ یعنی جستجوی مشکلات و بهبود گاردریلها (محافظها) در پاسخ به آنها. اما این رویکرد، ذاتاً شکستهای دورهای را تضمین میکند—و دامنه این شکستها با افزایش توانمندی سیستمها رو به گسترش است. تابستان امسال، در حادثه هاگینگفیس (Hugging Face)، اوپنایآی بهاشتباه اجازه داد دستهای از عاملهای هوش مصنوعی آزاد شوند. شرکت در پاسخ، بهبودهای امنیتی اعمال کرد. اما حتی پس از آن تغییرات، اوپنایآی گزارش داد که کنترلهای ایمنی آن دوباره ناکام ماندند، زمانی که مدلی در حال آموزش محدودیتهای دسترسی به اینترنت را دور زد: یک سیستم پایش به پرسنل انسانی هشدار داد، اما برخلاف انتظار، مدل را بهطور خودکار خاموش نکرد. انثروپیک (Anthropic) نیز بهطور تصادفی غیرفعال کردن محافظهای خود را به دلیل یک تنظیم نادرست پذیرفته است. من معتقدم چنین اشتباهاتی با توجه به سرعت و انعطافپذیری که افراد با آن کار میکنند، در این صنعت رایج است.
محیطی که چنین چیزهایی در آن رخ میدهند، جای مناسبی برای پرورش ذهنهای مصنوعی نیست که ممکن است از ما باهوشتر باشند و آنچه ما میخواهیم را انجام ندهند. پل کریستیانو (Paul Christiano)، که چند هفته پیش به هیئت مدیره اوپنایآی پیوست، نوشت که «ریسک معناداری وجود دارد که شتاب سریع در توانمندیهای هوش مصنوعی منجر به از دست دادن فاجعهبار و برگشتناپذیر کنترل در آینده بسیار نزدیک شود.» اگر این وضعیت حقیقت دارد، پس زمان آزمون و خطا به پایان رسیده است. چیزی بسیار نزدیک به کمال در اولین تلاش ضروری است، زیرا تکرار پس از یک اشتباه ممکن است امکانپذیر نباشد. اگر ما به قهرمانیهای فردی پس از وقوع حادثه وابسته باشیم، مردم ایمن نخواهند بود.
البته اوپنایآی از رویههای ایمنی خود دفاع میکند و ادعا میکند که به اندازه کافی محتاط است. من تصمیم ترک شرکت را سبک نگرفتم. من معتقدم این فناوری میتواند مفید و ارزشمند باشد. همکاران سابق من باهوش هستند، سخت کار میکنند و سعی میکنند انتخابهای خوبی داشته باشند. اما وقتی شرکت از یک راهاندازی به راهاندازی بعدی میدود، در رسیدن به سطح مراقبتی که من لازم میدانم، ناکام میماند. اکنون، من برنامه دارم از خارج شرکت کار کنم، به امید اینکه بتوانم به درک بهتر مخاطراتی که دیدم توسط افراد بیشتر کمک کنم و انگیزههای اوپنایآی و سایر شرکتها را برای ایمنتر شدن تقویت کنم. مانند سایر همکاران، من دقیقاً مشخص نمیکنم این چه معنایی دارد. پس از استعفا، من از یک شرکت روابط عمومی، اسپایتفایر استراتژیز (Spitfire Strategies)، کمک گرفتم تا توجه و نظارتی که آگاهم ممکن است دریافت کنم را مدیریت کنم. اما تصمیم برای سخن گفتن کاملاً متعلق به خودم است.
دو تغییر فوراً مورد نیاز است. اول: شرکتهای هوش مصنوعی باید بیشتر به تخصص ایمنی موجود در سایر حوزهها تکیه کنند. و دوم، قبل از اینکه سیستمهایی بسازیم که بهطور قابلتوجهی قدرتمندتر از سیستمهای امروز ما باشند، به علم جدیدی نیاز داریم تا اطمینان حاصل کنیم که مدلهای قدرتمندتر (و جانشینان آنها) زمانی که ما ناظر نیستیم، انتخابهای ایمنی انجام میدهند.
با توجه به ریسکهای امروز، آزمایشگاههای مرزی باید مانند نیروگاههای هستهای یا فرودگاههای شلوغ عمل کنند، با لایههای افزونگی و برنامهریزی دقیق و زمانبر، تا خطای انسانی گاهبهگاه و اجتنابناپذیر دریچهای به سوی فاجعه باز نکند. در حال حاضر شرکتهای هوش مصنوعی نمیدانند چگونه—اما دیگران میدانند. در یک نیروگاه هستهای، سیستمهای فنی و قوانینی که مردم رعایت میکنند به گونهای تنظیم شدهاند که اگر تجهیزات خراب شود یا کسی دکمه اشتباهی را فشار دهد، همچنان خطر ذوب راکتور وجود نداشته باشد. اوپنایآی و سایر آزمایشگاهها هوش مصنوعی مرزی را با افزونگی و دقت بسیار کمتری نسبت به این استاندارد توسعه داده و مستقر میکنند، حتی اگر آسیب ناشی از از دست دادن برگشتناپذیر کنترل بسیار بیشتر از هرگونه ذوب راکتور منفرد باشد. حتی بدون از دست دادن کامل کنترل، ما میتوانیم دستههای خودگردان عاملهای هوش مصنوعی را ببینیم که بدون اجازه انسانی عمل میکنند. تصور کنید عاملهای «سرکش» که مانند تیمهای هکر عمل میکنند (مثلاً سیستمهای کامپیوتری بیمارستانها را گروگان میگیرند) اما هرگز نیازی به خواب ندارند.
پس از سه سال و نیم حضور در اوپنایآی، من جزو کارکنانی بودم که بیشترین سابقه را در شرکت داشتند. من مسئول تدوین چارچوب آمادگی فعلی خود بودم و بر نوشتن گزارشهای ایمنی برای ۱۲ راهاندازی مدلهای مرزی نظارت داشتم. اما تا جایی که میدانم، هرگز با همکاری مواجه نشدم که تجربه ایمن پرواز هواپیماها، اجرای بدون ذوب راکتورهای هستهای، یا کمک به رشد سیستم مالی بدون فروپاشی داشته باشد. برای روشن شدن موضوع، این یک نیاز جدید است: سیستمهای هوش مصنوعی امروز و فردا بسیار قدرتمندتر و خطرناکتر از سیستمهایی هستند که حتی شش ماه پیش میساختیم. شاید باید میماندم و برای تغییرات بنیادین در ترکیب کارکنان و فرهنگ شرکت مبارزه میکردم، اما در عمل، من و همکارانم آنقدر مشغول دویدن (اسپرینت) بودیم که بهندرت فرصتی برای در نظر گرفتن تغییرات بزرگ داشتیم، چه برسد به اجرای واقعی آنها. به همین دلیل نتیجه گرفتم که انگیزههای قویتر برای ایمنی—که از خارج شرکت میآیند—بخش بزرگی از درست انجام دادن این کار است.
در بلندمدت، اگرچه کنترلهای قوی ضروری هستند، اما کافی نخواهند بود. قبل از اینکه هوش مصنوعی شروع به فکر کردن دور سر ما کند—احتمالی که من معتقدم میتواند زود اتفاق بیفتد—ما باید به یک سوال عمیقتر پاسخ دهیم: ماشینهای ابرهوشمند چگونه باید با مردم رابطه برقرار کنند؟ اگر به طرفداران ابرهوش گوش دهید، برخی از آیندههای ظاهراً خوب شامل خلق ماشینهایی است که میتوانند به شهر نیویورک یا شیکاگو مانند تپه مورچهای که شما یا من مشاهده میکنیم، نگاه کنند. من چنین چیزی را برای فرزندانم نمیخواهم و فکر میکنم دیگران نیز چنین نظری دارند.
این سوال در مورد «همسویی» (Alignment)—یا اینکه چگونه میتوان هوش مصنوعی را آموزش داد تا به ارزشهای انسانی پایبند باشد—ممکن است احساسی به نظر برسد، اما پیامدهای عملی آن نمیتواند بالاتر باشد. در حال حاضر، ما تعریف کاملی از اینکه همسو بودن یک سیستم هوش مصنوعی در عمل چه معنایی دارد نداریم، و معیارهای ما برای میزان تطابق این سیستمها با ارزشهای انسانی ناپخته است. شرکتها هیچ قطعیتی ندارند که نمرات خوب در تستهای همسویی آنها واقعاً به معنای یک مدل خوب باشد: مدلها ممکن است تشخیص دهند که در حال تست هستند و هنگام استقرار رفتار متفاوتی نشان دهند. هرچه صنعت اجازه دهد مدلها باقی ماندن این مشکلات حلنشده باهوشتر شوند، موقعیت ما خطرناکتر میشود.
تاکنون، صنعت هوش مصنوعی در آموزش ماشینها برای عمل مداوم به شیوهای که یک فرد عاقل و مهربان انجام میدهد، ناکام بوده است. بخشی از این مشکل علمی است—درباره نحوه کار ماشینها—اما بخش دیگری انسانی است، درباره اینکه مردم چگونه به یکدیگر اهمیت میدهند. قبل از اینکه سازمانهای سازنده هوش مصنوعی بتوانند به یک ابرهوش بیاموزند که با بشریت رفتار خوبی داشته باشد، آنها باید یاد بگیرند چگونه خودشان این کار را انجام دهند.