اشتراک
محصول اطلاعیه‌ها

بهبود اقدامات ایمنی زیستی در Fable 5

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

شرکت آنتروپیک به‌تازگی اقدامات ایمنی زیستی مدل «فیبل ۵» (Fable 5) را به‌روزرسانی کرده است تا میزان خطاهای «مثبت کاذب» را تا ۸۵ درصد کاهش دهد. پیش از این، سیستم به‌دلیل حساسیت بالا، بسیاری از پرسش‌های آموزشی و روزمره مرتبط با زیست‌شناسی را مسدود و کاربران را به مدل‌های ضعیف‌تر ارجاع می‌داد، اما اکنون دسترسی کاربران به قابلیت‌های تخصصی فیبل ۵ در حوزه‌هایی مانند تفسیر نتایج آزمایشگاهی و آموزش زیست‌شناسی تسهیل شده است. هدف از این اقدامات، مدیریت هوشمندانه «کاربردهای دوگانه» است؛ چرا که قدرت بالای این مدل در تحلیل‌های پیچیده زیستی، در صورت استفاده نادرست، می‌تواند خطرات امنیتی جدی (مانند ساخت سلاح‌های بیولوژیکی) ایجاد کند. برای کنترل این مخاطرات، آنتروپیک همچنان پرسش‌های مربوط به حوزه‌های حساس نظیر ویروس‌شناسی و طراحی مولکولی را مسدود نگه داشته و برای استفاده‌های حرفه‌ای و تحقیقاتی، مسیرهای دسترسی کنترل‌شده و مورد اعتماد را جایگزین کرده است. فرآیند ایمن‌سازی مدل از طریق «طبقه‌بندهای هوشمند» انجام می‌شود که با تکیه بر قوانین دقیق و بازنگری‌های کارشناسی، مرز میان کاربردهای آموزشی بی‌ضرر و فعالیت‌های پرخطر را تفکیک می‌کنند. با وجود بهبودهای فعلی، این شرکت تأکید دارد که همچنان برای جلوگیری از سوءاستفاده‌های احتمالی، رویکردی محتاطانه را دنبال کرده و به اصلاح مستمر سیستم‌های حفاظتی خود ادامه خواهد داد تا تعادلی میان بهره‌وری علمی و امنیت جهانی برقرار سازد.

ما در حال به‌روزرسانی اقدامات ایمنی زیستی کلود فیبل ۵ به گونه‌ای هستیم که نتایج مثبت کاذب را به‌طور قابل توجهی کاهش می‌دهد. کاربران فیبل ۵ اکنون «بازگشت‌های» بسیار کمتری را تجربه خواهند کرد—جایی که سیستم پس از یک پرسش مرتبط با زیست‌شناسی به مدلی با توانایی کمتر تغییر می‌کند. در آزمایش‌های ما، این به‌روزرسانی بازگشت‌های مرتبط با زیست‌شناسی را در سطح محصولات ما حدود ۸۵٪ کاهش داد.1

بنابراین فیبل ۵ قادر خواهد بود در طیف وسیع‌تری از وظایف زیست‌شناسی کمک کند.

در عمل، کاربران باید بازگشت‌های بسیار کمتری را در پرسش‌های روزمره سلامت و آموزشی ببینند—برای مثال، تفسیر نتایج آزمایشگاهی، درک علائم، و یادگیری زیست‌شناسی در یک بافت آموزشی. متخصصان مراقبت‌های بهداشتی قادر خواهند بود در وظایف بالینی از فیبل ۵ پشتیبانی بیشتری دریافت کنند.

ما معتقدیم بزرگ‌ترین فرصت برای تأثیر مثبت هوش مصنوعی بر جهان در حوزه زیست‌شناسی و پزشکی است و ما به‌طور قابل توجهی در حال سرمایه‌گذاری برای ایجاد یک روش مسئولانه برای دسترسی پیشرو به زیست‌شناسان هستیم. امروز، فیبل همچنان برای درخواست‌هایی که آن‌ها را دارای کاربرد دوگانه می‌دانیم—از جمله ویروس‌شناسی، سم‌شناسی، و طراحی مولکولی—به Opus 5 بازگشت می‌کند، بنابراین هنوز برای تحقیقات حرفه‌ای زیست‌شناسی و توسعه دارو قابل استفاده نیست. ما متعهد به پر کردن این شکاف از طریق مسیرهای دسترسی مورد اعتماد برای قابلیت‌های پیشرو زیست‌شناسی هستیم.

چرا اقدامات ایمنی زیستی قوی ساختیم

هدف ما این است که قابلیت‌های پیشرو فیبل ۵ را در اسرع وقت در اختیار هرچه بیشتر کاربران خود قرار دهیم. با این حال، برای انجام این کار، باید خطرات فزاینده‌ای را که با مدل‌های با این سطح از توانایی همراه است مدیریت کنیم. یکی از این خطرات در حوزه زیست‌شناسی است: فیبل ۵ اکنون می‌تواند در برخی از وظایف بسیار پیچیده زیستی از متخصصان بهتر عمل کند و در سایر موارد پشتیبانی عملیاتی ارائه دهد. این بدان معناست که می‌تواند به یک محقق در حال توسعه یک درمان پزشکی جدید کمک واقعی کند (دلیلی که ما مشتاق گسترش دسترسی به مدل از طریق بهبود طبقه‌بندها و برنامه‌های دسترسی مورد اعتماد هستیم). اما در دستان اشتباه، همان قابلیت‌ها می‌تواند توسط یک عامل مخرب، به عنوان مثال در توسعه سلاح بیولوژیکی، مورد استفاده قرار گیرد. ارزیابی‌های قابلیت ما نشان می‌دهد که فیبل ۵ می‌تواند ارتقای قابل توجهی به چنین عاملی بدهد—یعنی می‌تواند قابلیت‌هایی را در اختیار او قرار دهد که در هیچ جای دیگری نمی‌تواند پیدا کند.

اغلب تشخیص کاربردهای مفید و مضر هوش مصنوعی در زیست‌شناسی دشوار است. به عنوان مثال، در برخی موارد، تحقیق در مورد درمان یک بیماری مستلزم آن است که دانشمندان ترکیبات خطرناکی را تولید کنند که در وهله اول باعث آن بیماری می‌شوند. این امر در مورد واکسن‌های زنده که دانشمندان باید همان پاتوژنی را که هدفشان پیشگیری از آن است رشد دهند، آشکارتر است. این مورد در مورد برخی داروها نیز صادق است. برای توسعه داروی کاپتوپریل که فشار خون بالا را درمان می‌کند، دانشمندان اجزای سمی زهر مار را که فشار خون را در انسان به شدت کاهش می‌دهد، جدا کردند. با توسعه قابلیت‌های بیولوژیکی جدید در مرز هوش مصنوعی، ما باید محتاط باشیم تا اطمینان حاصل کنیم که خطرات جدیدی که ایجاد می‌کنند قبل از مزایای علمی بالقوه آن‌ها تحقق نیابند.

بازیگران پیچیده‌ای که می‌خواهند از مدل‌های ما برای آسیب رساندن استفاده کنند، می‌دانند چگونه از این ابهام برای پنهان کردن نیت خود سوءاستفاده کنند و وظایف خطرناک را شبیه به فعالیت‌های تحقیقاتی عادی جلوه دهند. ارزیابی تهدید سالانه ۲۰۲۶ جامعه اطلاعاتی ایالات متحده روشن می‌کند که چنین بازیگرانی وجود دارند و پیشرفت‌های بیوتکنولوژی از جمله زیست‌شناسی مصنوعی و ویرایش ژنومی «می‌تواند منجر به تهدیدات بیولوژیکی جدیدی شود.» این ارزیابی خاطرنشان می‌کند که چندین بازیگر دولتی احتمالاً برنامه‌های تهاجمی فعال سلاح‌های بیولوژیکی و شیمیایی دارند—برنامه‌هایی که می‌توانند با دسترسی به قابلیت‌های خام مدل‌های هوش مصنوعی پیشرو تسریع شوند.

به دلیل نگرانی‌های ما در مورد این قابلیت‌های «کاربرد دوگانه» (آنهایی که می‌توانند برای اهداف مفید یا مضر استفاده شوند و خط بین آن‌ها همیشه به راحتی قابل ترسیم نیست)، ما عمداً فیبل ۵ را با مسدود شدن تقریباً همه پرسش‌های زیست‌شناسی راه‌اندازی کردیم. این امر به ما امکان داد مدل را برای کاربران در حوزه‌های دیگر در دسترس قرار دهیم. ما می‌دانستیم که این برای کاربران قانونی زیست‌شناسی ناامیدکننده خواهد بود: در کوتاه مدت تعداد زیادی نتایج مثبت کاذب به همراه خواهد داشت، جایی که کاربرانی که سوالات مرتبط با زیست‌شناسی می‌پرسیدند، درخواست‌هایشان مسدود و به مدلی با توانایی کمتر ارسال می‌شد. با این وجود، ما این معامله را انتخاب کردیم زیرا هزینه سوءاستفاده از فیبل در یک حوزه با کاربرد دوگانه مانند زیست‌شناسی به طور بالقوه می‌تواند فاجعه‌بار باشد.

اقدامات ایمنی زیستی ما چگونه کار می‌کنند

یکی از راه‌های اصلی که ما در برابر سوءاستفاده در زیست‌شناسی محافظت می‌کنیم، از طریق طبقه‌بندهای ایمنی است: سیستم‌های هوش مصنوعی خودکار کوچکتر که تشخیص می‌دهند چه زمانی از فیبل ۵ خواسته می‌شود یک کار زیست‌شناسی محافظت‌شده انجام دهد یا خروجی مضر تولید کند (ما قبلاً در مورد طبقه‌بندهای مشابه خود در حوزه امنیت سایبری نوشته‌ایم).

در مورد فیبل ۵، وقتی یک طبقه‌بند فعال می‌شود، مدل درخواست کاربر را به Opus 5 هدایت می‌کند، مدلی توانمند که سطح توانایی زیستی مشابه فیبل ۵ را ندارد و نمی‌تواند به همان اندازه به یک کاربر مخرب کمک کند. این همان بازگشتی است که کاربران هنگام مسدود شدن درخواست‌هایشان می‌بینند.

توسعه طبقه‌بندهای دقیق و مقاوم کار ساده‌ای نیست. برای اینکه یک طبقه‌بند سریع و سازگار عمل کند، باید تفاوت بین آنچه ما «در محدوده» و «خارج از محدوده» برای موضوعات و پرسش‌هایی که بالقوه مضر می‌دانیم، یاد بگیرد. تنظیم طبقه‌بندها زمان و تکرار می‌برد و از هر دو نتیجه مثبت کاذب (جایی که طبقه‌بندها روی محتوای خارج از محدوده فعال می‌شوند) و منفی کاذب (جایی که محتوای در محدوده از دست می‌رود) اجتناب می‌کند. ما همچنین نیاز داریم که طبقه‌بندهای ما در برابر تلاش‌ها برای دور زدن آن‌ها (معروف به jailbreak) مقاوم باشند، که به تحقیقات و آزمایش‌های بیشتری نیاز دارد.

شروع با یک طبقه‌بند زیست‌شناسی بسیار گسترده به این معنی بود که می‌توانستیم دسترسی کاربران را به فیبل ۵ فراهم کنیم در حالی که تحقیقات خود را با هدف اصلاح آن ادامه می‌دادیم. جایگزین—نگه داشتن مدل تا زمانی که پیشرفت‌های ایمنی بسیار بیشتری حاصل شود—دسترسی عمومی به مدل و مزایای بالقوه آن را برای کاربران هفته‌ها یا ماه‌ها به تأخیر می‌انداخت.

در طول چند هفته گذشته، ما با دقت قانون اساسی طبقه‌بند را بازنویسی کرده‌ایم (که شامل مجموعه‌ای از قوانین برای کمک به مدل در تشخیص بین محتوای محافظت‌شده و مجاز است)، و با دقت موارد استفاده بی‌ضرر را به تفصیل مشخص کرده‌ایم. ما بازخوردی در مورد تغییرات از طیف متنوعی از کارشناسان (داخلی و خارجی Anthropic) دریافت کردیم. سپس داده‌های آموزشی به‌روزرسانی‌شده‌ای برای طبقه‌بند بر اساس آن قانون اساسی ایجاد کردیم، آن را دوباره آموزش دادیم و تأیید کردیم که طبقه‌بند جدید همچنان به طور کلی برای محتوای تحقیقاتی زیست‌شناسی مضر و با کاربرد دوگانه فعال می‌شود، اما اکنون طیف وسیع‌تری از کاربردهای بی‌ضرر و مفید را امکان‌پذیر می‌کند.

تصویری از طبقه‌بندهای زیست‌شناسی ما. محتوایی که در سمت چپ مرز طبقه‌بند قرار می‌گیرد مجاز است؛ محتوایی که در سمت راست قرار می‌گیرد محافظت‌شده است (و بنابراین مسدود شده و به مدلی با توانایی کمتر ارسال می‌شود). محتوای کاملاً مضر (قرمز) و محتوایی که کاربرد دوگانه دارد (نارنجی)، طبقه‌بند را فعال کرده و مسدود می‌شود. ما یک حاشیه ایمنی شامل محتوایی که به احتمال زیاد بی‌ضرر است اما همچنان از روی احتیاط بیش از حد مسدود می‌شود (سبز روشن) در نظر گرفته‌ایم. محتوای کاملاً بی‌ضرر به رنگ سبز تیره است. در زمان عرضه، فیبل ۵ طبقه‌بندهای بسیار گسترده‌ای داشت (A) که بر روی طیف وسیعی از درخواست‌ها—حتی آنهایی که تقریباً مطمئناً بی‌ضرر بودند (آنهایی که در حاشیه ایمنی قرار دارند)—فعال می‌شدند. بنابراین مرز طبقه‌بند بسیار به سمت چپ نمودار است. به‌روزرسانی که امروز اعلام می‌کنیم (B) به این معنی است که درخواست‌های بی‌ضرر بسیار بیشتری توسط طبقه‌بند مجاز می‌شوند، که در تشخیص تفاوت‌های ظریف بین پرسش‌های بی‌ضرر و با کاربرد دوگانه بهتر شده است. بنابراین مرز طبقه‌بند در نمودار به سمت راست حرکت کرده است.

همانطور که در نمودار زیر نشان داده شده است، این به‌روزرسانی‌ها به این معنی بود که—در مقایسه با زمان عرضه فیبل ۵—طبقه‌بند برای درخواست‌های بی‌ضرر بسیار کمتری مرتبط با زیست‌شناسی فعال می‌شود.

نتیجه‌گیری

هنوز کارهای زیادی برای اصلاح اقدامات ایمنی ما باقی مانده است. ناگزیر نتایج مثبت کاذب باقی خواهند ماند—درخواست‌هایی که در حاشیه ایمنی طبقه‌بند قرار می‌گیرند، جایی که درخواست بسیار کم‌خطر است اما طبقه‌بند همچنان فعال می‌شود. همانطور که در بالا اشاره کردیم، فیبل به دلیل خطر بالقوه کاربرد دوگانه، همچنان به مسدود کردن پرسش‌های حرفه‌ای زیست‌شناسی و توسعه دارو ادامه خواهد داد. ما کاملاً متعهد به توسعه یک مسیر امن و مقیاس‌پذیر برای محققان برای استفاده از توانمندترین مدل‌های خود از طریق مسیرهای دسترسی مورد اعتماد هستیم.

امیدواریم همچنان بازخورد خود را با ما در میان بگذارید تا بتوانیم اقدامات ایمنی خود را بیشتر بهبود بخشیم.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: anthropic.com