ما در حال بهروزرسانی اقدامات ایمنی زیستی کلود فیبل ۵ به گونهای هستیم که نتایج مثبت کاذب را بهطور قابل توجهی کاهش میدهد. کاربران فیبل ۵ اکنون «بازگشتهای» بسیار کمتری را تجربه خواهند کرد—جایی که سیستم پس از یک پرسش مرتبط با زیستشناسی به مدلی با توانایی کمتر تغییر میکند. در آزمایشهای ما، این بهروزرسانی بازگشتهای مرتبط با زیستشناسی را در سطح محصولات ما حدود ۸۵٪ کاهش داد.1
بنابراین فیبل ۵ قادر خواهد بود در طیف وسیعتری از وظایف زیستشناسی کمک کند.
در عمل، کاربران باید بازگشتهای بسیار کمتری را در پرسشهای روزمره سلامت و آموزشی ببینند—برای مثال، تفسیر نتایج آزمایشگاهی، درک علائم، و یادگیری زیستشناسی در یک بافت آموزشی. متخصصان مراقبتهای بهداشتی قادر خواهند بود در وظایف بالینی از فیبل ۵ پشتیبانی بیشتری دریافت کنند.
ما معتقدیم بزرگترین فرصت برای تأثیر مثبت هوش مصنوعی بر جهان در حوزه زیستشناسی و پزشکی است و ما بهطور قابل توجهی در حال سرمایهگذاری برای ایجاد یک روش مسئولانه برای دسترسی پیشرو به زیستشناسان هستیم. امروز، فیبل همچنان برای درخواستهایی که آنها را دارای کاربرد دوگانه میدانیم—از جمله ویروسشناسی، سمشناسی، و طراحی مولکولی—به Opus 5 بازگشت میکند، بنابراین هنوز برای تحقیقات حرفهای زیستشناسی و توسعه دارو قابل استفاده نیست. ما متعهد به پر کردن این شکاف از طریق مسیرهای دسترسی مورد اعتماد برای قابلیتهای پیشرو زیستشناسی هستیم.
چرا اقدامات ایمنی زیستی قوی ساختیم
هدف ما این است که قابلیتهای پیشرو فیبل ۵ را در اسرع وقت در اختیار هرچه بیشتر کاربران خود قرار دهیم. با این حال، برای انجام این کار، باید خطرات فزایندهای را که با مدلهای با این سطح از توانایی همراه است مدیریت کنیم. یکی از این خطرات در حوزه زیستشناسی است: فیبل ۵ اکنون میتواند در برخی از وظایف بسیار پیچیده زیستی از متخصصان بهتر عمل کند و در سایر موارد پشتیبانی عملیاتی ارائه دهد. این بدان معناست که میتواند به یک محقق در حال توسعه یک درمان پزشکی جدید کمک واقعی کند (دلیلی که ما مشتاق گسترش دسترسی به مدل از طریق بهبود طبقهبندها و برنامههای دسترسی مورد اعتماد هستیم). اما در دستان اشتباه، همان قابلیتها میتواند توسط یک عامل مخرب، به عنوان مثال در توسعه سلاح بیولوژیکی، مورد استفاده قرار گیرد. ارزیابیهای قابلیت ما نشان میدهد که فیبل ۵ میتواند ارتقای قابل توجهی به چنین عاملی بدهد—یعنی میتواند قابلیتهایی را در اختیار او قرار دهد که در هیچ جای دیگری نمیتواند پیدا کند.
اغلب تشخیص کاربردهای مفید و مضر هوش مصنوعی در زیستشناسی دشوار است. به عنوان مثال، در برخی موارد، تحقیق در مورد درمان یک بیماری مستلزم آن است که دانشمندان ترکیبات خطرناکی را تولید کنند که در وهله اول باعث آن بیماری میشوند. این امر در مورد واکسنهای زنده که دانشمندان باید همان پاتوژنی را که هدفشان پیشگیری از آن است رشد دهند، آشکارتر است. این مورد در مورد برخی داروها نیز صادق است. برای توسعه داروی کاپتوپریل که فشار خون بالا را درمان میکند، دانشمندان اجزای سمی زهر مار را که فشار خون را در انسان به شدت کاهش میدهد، جدا کردند. با توسعه قابلیتهای بیولوژیکی جدید در مرز هوش مصنوعی، ما باید محتاط باشیم تا اطمینان حاصل کنیم که خطرات جدیدی که ایجاد میکنند قبل از مزایای علمی بالقوه آنها تحقق نیابند.
بازیگران پیچیدهای که میخواهند از مدلهای ما برای آسیب رساندن استفاده کنند، میدانند چگونه از این ابهام برای پنهان کردن نیت خود سوءاستفاده کنند و وظایف خطرناک را شبیه به فعالیتهای تحقیقاتی عادی جلوه دهند. ارزیابی تهدید سالانه ۲۰۲۶ جامعه اطلاعاتی ایالات متحده روشن میکند که چنین بازیگرانی وجود دارند و پیشرفتهای بیوتکنولوژی از جمله زیستشناسی مصنوعی و ویرایش ژنومی «میتواند منجر به تهدیدات بیولوژیکی جدیدی شود.» این ارزیابی خاطرنشان میکند که چندین بازیگر دولتی احتمالاً برنامههای تهاجمی فعال سلاحهای بیولوژیکی و شیمیایی دارند—برنامههایی که میتوانند با دسترسی به قابلیتهای خام مدلهای هوش مصنوعی پیشرو تسریع شوند.
به دلیل نگرانیهای ما در مورد این قابلیتهای «کاربرد دوگانه» (آنهایی که میتوانند برای اهداف مفید یا مضر استفاده شوند و خط بین آنها همیشه به راحتی قابل ترسیم نیست)، ما عمداً فیبل ۵ را با مسدود شدن تقریباً همه پرسشهای زیستشناسی راهاندازی کردیم. این امر به ما امکان داد مدل را برای کاربران در حوزههای دیگر در دسترس قرار دهیم. ما میدانستیم که این برای کاربران قانونی زیستشناسی ناامیدکننده خواهد بود: در کوتاه مدت تعداد زیادی نتایج مثبت کاذب به همراه خواهد داشت، جایی که کاربرانی که سوالات مرتبط با زیستشناسی میپرسیدند، درخواستهایشان مسدود و به مدلی با توانایی کمتر ارسال میشد. با این وجود، ما این معامله را انتخاب کردیم زیرا هزینه سوءاستفاده از فیبل در یک حوزه با کاربرد دوگانه مانند زیستشناسی به طور بالقوه میتواند فاجعهبار باشد.
اقدامات ایمنی زیستی ما چگونه کار میکنند
یکی از راههای اصلی که ما در برابر سوءاستفاده در زیستشناسی محافظت میکنیم، از طریق طبقهبندهای ایمنی است: سیستمهای هوش مصنوعی خودکار کوچکتر که تشخیص میدهند چه زمانی از فیبل ۵ خواسته میشود یک کار زیستشناسی محافظتشده انجام دهد یا خروجی مضر تولید کند (ما قبلاً در مورد طبقهبندهای مشابه خود در حوزه امنیت سایبری نوشتهایم).
در مورد فیبل ۵، وقتی یک طبقهبند فعال میشود، مدل درخواست کاربر را به Opus 5 هدایت میکند، مدلی توانمند که سطح توانایی زیستی مشابه فیبل ۵ را ندارد و نمیتواند به همان اندازه به یک کاربر مخرب کمک کند. این همان بازگشتی است که کاربران هنگام مسدود شدن درخواستهایشان میبینند.
توسعه طبقهبندهای دقیق و مقاوم کار سادهای نیست. برای اینکه یک طبقهبند سریع و سازگار عمل کند، باید تفاوت بین آنچه ما «در محدوده» و «خارج از محدوده» برای موضوعات و پرسشهایی که بالقوه مضر میدانیم، یاد بگیرد. تنظیم طبقهبندها زمان و تکرار میبرد و از هر دو نتیجه مثبت کاذب (جایی که طبقهبندها روی محتوای خارج از محدوده فعال میشوند) و منفی کاذب (جایی که محتوای در محدوده از دست میرود) اجتناب میکند. ما همچنین نیاز داریم که طبقهبندهای ما در برابر تلاشها برای دور زدن آنها (معروف به jailbreak) مقاوم باشند، که به تحقیقات و آزمایشهای بیشتری نیاز دارد.
شروع با یک طبقهبند زیستشناسی بسیار گسترده به این معنی بود که میتوانستیم دسترسی کاربران را به فیبل ۵ فراهم کنیم در حالی که تحقیقات خود را با هدف اصلاح آن ادامه میدادیم. جایگزین—نگه داشتن مدل تا زمانی که پیشرفتهای ایمنی بسیار بیشتری حاصل شود—دسترسی عمومی به مدل و مزایای بالقوه آن را برای کاربران هفتهها یا ماهها به تأخیر میانداخت.
در طول چند هفته گذشته، ما با دقت قانون اساسی طبقهبند را بازنویسی کردهایم (که شامل مجموعهای از قوانین برای کمک به مدل در تشخیص بین محتوای محافظتشده و مجاز است)، و با دقت موارد استفاده بیضرر را به تفصیل مشخص کردهایم. ما بازخوردی در مورد تغییرات از طیف متنوعی از کارشناسان (داخلی و خارجی Anthropic) دریافت کردیم. سپس دادههای آموزشی بهروزرسانیشدهای برای طبقهبند بر اساس آن قانون اساسی ایجاد کردیم، آن را دوباره آموزش دادیم و تأیید کردیم که طبقهبند جدید همچنان به طور کلی برای محتوای تحقیقاتی زیستشناسی مضر و با کاربرد دوگانه فعال میشود، اما اکنون طیف وسیعتری از کاربردهای بیضرر و مفید را امکانپذیر میکند.
همانطور که در نمودار زیر نشان داده شده است، این بهروزرسانیها به این معنی بود که—در مقایسه با زمان عرضه فیبل ۵—طبقهبند برای درخواستهای بیضرر بسیار کمتری مرتبط با زیستشناسی فعال میشود.
نتیجهگیری
هنوز کارهای زیادی برای اصلاح اقدامات ایمنی ما باقی مانده است. ناگزیر نتایج مثبت کاذب باقی خواهند ماند—درخواستهایی که در حاشیه ایمنی طبقهبند قرار میگیرند، جایی که درخواست بسیار کمخطر است اما طبقهبند همچنان فعال میشود. همانطور که در بالا اشاره کردیم، فیبل به دلیل خطر بالقوه کاربرد دوگانه، همچنان به مسدود کردن پرسشهای حرفهای زیستشناسی و توسعه دارو ادامه خواهد داد. ما کاملاً متعهد به توسعه یک مسیر امن و مقیاسپذیر برای محققان برای استفاده از توانمندترین مدلهای خود از طریق مسیرهای دسترسی مورد اعتماد هستیم.
امیدواریم همچنان بازخورد خود را با ما در میان بگذارید تا بتوانیم اقدامات ایمنی خود را بیشتر بهبود بخشیم.