اشتراک
فناوری هوش مصنوعی کسب و کار

معرفی کلود اوپوس ۵

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

کلود اوپوس ۵ به عنوان جدیدترین و پیشرفته‌ترین مدل هوش مصنوعی آنتروپیک معرفی شده است که با حفظ همان هزینه مدل قبلی، عملکردی به‌مراتب ارتقایافته در وظایف دانشی، کدنویسی و حل مسائل پیچیده ارائه می‌دهد. این مدل که برای استفاده‌های روزمره بهینه شده، در ارزیابی‌های فنی نظیر «فرانتیر-بنچ» و «او‌اس‌ورلد» از مدل‌های پیشین پیشی گرفته و توانمندی بالایی در خودمختاری، استدلال و تولید خروجی‌های دقیق دارد. از ویژگی‌های برجسته این مدل می‌توان به درک عمیق مسائل، توانایی بازسازی هندسه سه‌بعدی و حل دقیق باگ‌های نرم‌افزاری اشاره کرد. در حوزه همسویی و ایمنی، اوپوس ۵ همراه‌ترین مدل آنتروپیک با «قانون اساسی کلود» است و با نرخ پایین رفتارهای فریبنده و آسیب‌پذیری، در جایگاه ایمن‌ترین محصول این شرکت قرار می‌گیرد. اگرچه این مدل در زمینه‌هایی مانند امنیت سایبری تهاجمی و تحقیقات زیست‌شناسی تخصصی از مدل «میتوس ۵» عقب‌تر است، اما محافظت‌های هوشمندانه آن اجازه می‌دهد تا کاربران با امنیت بالا از قابلیت‌های آن بهره‌مند شوند. امکانات ویژه‌ای همچون «حالت سریع» و «بازگشت خودکار» در API، انعطاف‌پذیری توسعه‌دهندگان را افزایش داده و استفاده از این مدل را در پلتفرم‌های کلود تسهیل کرده است. در مجموع، کلود اوپوس ۵ با تکیه بر کارایی اقتصادی و قدرت حل مسئله در کارهای تجاری و علمی، استانداردی نوین در هوش مصنوعی کاربردی محسوب می‌شود.

کلود اوپوس ۵ امروز در دسترس است. این یک مدل متفکر و فعال است که با نصف قیمت، به هوش مرزی کلود فیبل ۵ نزدیک می‌شود.

در ارزیابی‌های کدنویسی و کارهای دانشی مانند «فرانتیر-بنچ» (Frontier-Bench) و «جی‌دی‌پی‌ول-اِی‌اِی» (GDPval-AA)، اوپوس ۵ جدیدترین و پیشرفته‌ترین مدل است، اگرچه در وظایف امنیت سایبری از میتوس ۵ عقب‌تر است.

اوپوس ۵ برای استفاده روزمره طراحی شده است: این مدل کارآمدتر از سایر مدل‌ها عمل می‌کند. این مدل پیش‌فرض جدید در کلود مکس و قوی‌ترین مدل در کلود پرو است.

عملکرد و مقرون به صرفه بودن

کلود اوپوس ۵ عملکردی بسیار بهبود یافته را با همان هزینه مدل قبلی خود، اوپوس ۴.۸، ارائه می‌دهد. نمودارهای این بخش نشان می‌دهند که چگونه عملکرد بر اساس تنظیمات تلاش مدل تغییر می‌کند، که مشتریان می‌توانند از آن برای بهینه‌سازی هوش یا صرفه‌جویی در توکن‌ها برای نتایج سریع‌تر و ارزان‌تر استفاده کنند.

اوپوس ۵ در وظایف مهندسی نرم‌افزار ارزشمند برتری دارد. به عنوان مثال، در «فرانتیر-بنچ نسخه ۰.۱» (Frontier-Bench v0.1)، اوپوس ۵ از تمام مدل‌های دیگر پیشی می‌گیرد و عملکرد اوپوس ۴.۸ را با هزینه کمتر به ازای هر وظیفه، بیش از دو برابر می‌کند. در «کرسر-بنچ ۳.۲» (CursorBench 3.2)، با حداکثر تلاش، این مدل در ۰.۵ درصد از بالاترین امتیاز فیبل ۵ عمل می‌کند، اما با نصف هزینه به ازای هر وظیفه؛ همچنین در تلاش‌های بالا، بسیار بالا و حداکثر، عملکرد بیشتری را با هزینه مشخص نسبت به سایر مدل‌ها به دست می‌آورد.

ما نتایج مشابهی را در کارهای دانشی و وظایف حل مسئله مشاهده می‌کنیم. به عنوان مثال:

  • در «اِی‌آر‌سی-اِی‌جی‌آی ۳» (ARC-AGI 3)، یک ارزیابی که در آن مدل باید مسائل جدید را حل کند، امتیاز اوپوس ۵ سه برابر بالاتر از بهترین مدل بعدی است.
  • در «زپیر اتومیشن-بنچ» (Zapier AutomationBench)، که اندازه‌گیری می‌کند آیا مدل‌ها می‌توانند وظایف تجاری را از ابتدا تا انتها تکمیل کنند، نرخ موفقیت اوپوس ۵ حدود ۱.۵ برابر بهترین مدل بعدی برای همان هزینه به ازای هر وظیفه است. حتی در پایین‌ترین تنظیمات تلاش خود، اوپوس ۵ وظایف بیشتری را نسبت به هر مدل دیگری با موفقیت انجام می‌دهد.
  • در «او‌اس‌ورلد ۲.۰» (OSWorld 2.0)، یک معیار استفاده از کامپیوتر، اوپوس ۵ در هر هزینه‌ای از هر مدل دیگری بهتر عمل می‌کند و از بهترین نتیجه فیبل ۵ با کمی بیش از یک سوم هزینه پیشی می‌گیرد.

عملکرد و مقرون به صرفه بودن

همچنین این مدل بهترین و مقرون به صرفه‌ترین مدل ما در چندین ارزیابی مرتبط است:

اوپوس ۵ یک بهبود قابل توجه نسبت به اوپوس ۴.۸ برای تحقیقات علمی است. این مدل عملکرد بهتری نسبت به اوپوس ۴.۸ در هر یک از ارزیابی‌های علوم زیستی ما نشان می‌دهد، که شامل موضوعاتی مانند زیست‌شناسی ساختاری، شیمی آلی و بیوانفورماتیک است. بهبودهای آن به ویژه در وظایف شیمی آلی، مانند استنتاج ساختارهای مولکولی از داده‌های طیف‌سنجی (۱۰.۲ درصد امتیاز بالاتر از اوپوس ۴.۸ در معیار داخلی ما) و در وظایف مرتبط با پروتئین مانند پیش‌بینی چگونگی تأثیر تغییرات در توالی پروتئین بر عملکرد آن (در اینجا، ۷.۷ درصد امتیاز بالاتر) قابل توجه است.

در نهایت، اوپوس ۵ قادر به تولید خروجی‌های بصری بسیار قوی‌تری است:

کار با کلود اوپوس ۵

کلود اوپوس ۵ در تأیید کار خود و تکرار دقیق تا زمان موفقیت بسیار قوی‌تر است. در ارزیابی‌ها و آزمایش‌های دسترسی اولیه، ما و کاربرانمان نمونه‌های بسیاری از قابلیت و دقت اوپوس ۵ را یافتیم:

  • در یکی از وظایف «فرانتیر-بنچ» (Frontier-Bench)، به اوپوس ۵ یک نقاشی از یک قطعه ماشین داده شد و از آن خواسته شد تا کدی برای بازسازی آن به عنوان یک مدل سه‌بعدی FreeCAD بنویسد. با این حال، در این وظیفه، عمداً هیچ راهی برای مشاهده مستقیم نقاشی به مدل داده نشد. اوپوس ۵ با نوشتن خط لوله بینایی کامپیوتری خود برای استخراج هندسه از پیکسل‌های خام، سپس بازسازی کامل قطعه ماشین، پاسخ داد. این مدل بارها در انجام این کار موفق بود؛ هیچ مدل رقیبی با همین تنظیمات نتوانست پس از پنج بار تلاش آن را حل کند.
  • با توجه به یک باگ واقعی در یک مدیر بسته متن‌باز محبوب، اوپوس ۵ علت اصلی را پیدا کرد و یک مورد خاص را که پچ جامعه از دست داده بود، رفع کرد. یک مدل رقیب فقط علامت سطحی (نه علت اصلی) را رفع کرد، سپس گزارش داد که باگ حل شده است.
  • یک مهندس در یک شرکت تجاری از اوپوس ۵ برای ساخت یک فید داده بازار برای یک بورس جدید در یک جلسه واحد استفاده کرد. مدل‌های قبلی نتوانستند این وظیفه را به هیچ وجه تکمیل کنند، حتی با وجود برنامه‌های گسترده از سوی مهندس. اوپوس ۵ که هیچ فید زنده‌ای برای اعتبارسنجی پیدا نکرد، حتی ابزار تست خود را برای بررسی اینکه کدش داده‌های بورس را به درستی تجزیه می‌کند، ساخت.

در ادامه گزارش‌های بیشتری از مشتریان دسترسی اولیه ما در مورد تجربه کار با اوپوس ۵ آورده شده است:

در ممیزی رفتار خودکار ما، اوپوس ۵ امتیاز ۲.۳ را در رفتار نامنظم کلی کسب می‌کند که کمترین میزان در بین مدل‌های اخیر ما است.

همسویی و ایمنی

همسویی. در طول آزمایش‌های پیش از استقرار، ممیزی رفتار خودکار ما نشان داد که اوپوس ۵ همسوترین مدل ما تا به امروز است (همانطور که در نمودار زیر نشان داده شده است). این مدل بهتر از اوپوس ۴.۸، سونِت ۵ یا فیبل ۵ به «قانون اساسی کلود» (Claude’s Constitution) پایبند است؛ کمترین نرخ رفتارهای فریبنده را از خود نشان می‌دهد؛ و کمترین آسیب‌پذیری را در برابر فریب برای سوءاستفاده دارد. همچنین این مدل ایمن‌ترین مدل ما تا به امروز از نظر اجتناب از اقدامات بی‌پروا است که می‌تواند عوارض جانبی دشوار برای برگشت داشته باشد.

در OSS-Fuzz، یکی از ارزیابی‌های امنیت سایبری ما، اوپوس ۵ در شناسایی آسیب‌پذیری‌های نرم‌افزاری به میتوس ۵ نزدیک است (چپ)، اما در توسعه بهره‌برداری از آن‌ها (راست) به طور قابل توجهی کمتر موفق است.

همسویی و ایمنی

ایمنی. اوپوس ۵ در قابلیت‌های دوگانه و پرخطر پیشرفت نمی‌کند. در ارزیابی‌های دقیق انجام شده با همکاری شرکای بخش خصوصی و دولتی، ما دریافتیم که این مدل در تحقیقات زیست‌شناسی و امنیت سایبری تهاجمی از میتوس ۵ عقب‌تر است. اطلاعات بیشتر در مورد این ارزیابی‌ها را می‌توانید در «کارت سیستم» (System Card) ما بیابید.

مانند مدل قبلی خود، اوپوس ۴.۸، ما عمداً از آموزش اوپوس ۵ بر روی وظایف سایبری اجتناب کرده‌ایم. با این حال، این مدل به دلیل افزایش قابلیت‌های عمومی خود، در این وظایف به طور قابل توجهی بهبود یافته است و در یافتن آسیب‌پذیری‌های امنیت سایبری به میتوس ۵ نزدیک می‌شود. اما، در بهره‌برداری از این آسیب‌پذیری‌ها – یعنی تبدیل آسیب‌پذیری‌ها به تهدیدات سایبری مادی – به طور قابل توجهی از میتوس ۵ عقب‌تر است.

این موضوع با عملکرد اوپوس ۵ در «او‌اس‌اس-فاز» (OSS-Fuzz) نشان داده می‌شود، ارزیابی‌ای که ما برای سنجش میزان موفقیت مدل‌ها در یافتن و سپس بهره‌برداری از آسیب‌پذیری‌ها بدون راهنمایی گسترده انسانی توسعه داده‌ایم. اگرچه میتوس ۵ و اوپوس ۵ آسیب‌پذیری‌ها را با موفقیت مشابهی شناسایی می‌کنند، اما امتیاز اوپوس ۵ در توسعه بهره‌برداری‌ها بسیار عقب‌تر از میتوس ۵ است.

محافظت‌ها برای اوپوس ۵

محافظت‌های کلود اوپوس ۵ به گونه‌ای طراحی شده‌اند که امکان استفاده‌های مفید از مدل را هم در امنیت سایبری و هم در زیست‌شناسی فراهم کنند. این محافظت‌ها مشابه آن‌هایی هستند که ما برای اوپوس ۴.۸ اعمال کردیم، با این تفاوت که برخی از محافظت‌های قوی‌تر در محدوده باریکی از وظایف سایبری وجود دارد.

امنیت سایبری. دسته‌بندی‌کننده‌های سایبری اوپوس ۵ به نسبت کمتر از دسته‌بندی‌کننده‌های فیبل ۵ محدودکننده هستند. آن‌ها به اوپوس ۵ اجازه می‌دهند تا آسیب‌پذیری‌ها را در کد منبع پیدا کند، اما اسکن آسیب‌پذیری «مبتنی بر باینری» (روشی که احتمالاً با عوامل مخرب مرتبط است)، تست نفوذ و تولید بهره‌برداری را مسدود می‌کنند.

بر اساس آزمایش‌های ما، انتظار داریم که دسته‌بندی‌کننده‌ها حدود ۸۵ درصد کمتر از فیبل ۵ مداخله کنند. در Claude.ai، کلود کد و کلود کوورک، هر درخواست پرچم‌گذاری شده به طور پیش‌فرض به اوپوس ۴.۸ بازمی‌گردد. بازگشت به اوپوس ۴.۸ نیز می‌تواند در API فعال شود.

«برنامه تأیید سایبری» (CVP) ما کار امنیت سایبری را که در غیر این صورت توسط محافظت‌های مدل مختل می‌شد، تسهیل می‌کند. شرکت‌ها و محققانی که قبلاً بخشی از CVP هستند، دسترسی فوری به نسخه‌ای از اوپوس ۵ با محدودیت‌های امنیتی کمتر دارند.

زیست‌شناسی. از آنجایی که اوپوس ۵ مجموعه‌ای از محافظت‌های مشابه اوپوس ۴.۸ را دارد، اکنون قدرتمندترین مدل عمومی ما برای تحقیقات علمی است. با این حال، این مدل همچنان محدودیت‌های مهمی را در وظایف تحقیقاتی طولانی‌مدت و خودمختار نشان می‌دهد، که در آنجا انتظار داریم مدل‌های هوش مصنوعی بیشترین خطرات مرتبط با زیست‌شناسی را ایجاد کنند. (میتوس ۵ برای این نوع کارهای بیولوژیکی مدل قوی‌تری باقی می‌ماند.) به عنوان بخشی از این راه‌اندازی، درخواست‌های مرتبط با زیست‌شناسی که در فیبل ۵ مسدود می‌شوند، اکنون به جای اوپوس ۴.۸ به اوپوس ۵ هدایت می‌شوند.

شروع به کار

کلود اوپوس ۵ امروز در تمام پلتفرم‌ها با قیمت ۵ دلار به ازای هر میلیون توکن ورودی و ۲۵ دلار به ازای هر میلیون توکن خروجی (همانند اوپوس ۴.۸) در دسترس است. توسعه‌دهندگان می‌توانند با claude-opus-5 در API کلود شروع به کار کنند.

این مدل همچنین در حالت سریع (Fast mode) ارائه می‌شود، که در آن با سرعتی حدود ۲.۵ برابر سرعت پیش‌فرض اجرا می‌شود. همانند اوپوس ۴.۸، حالت سریع با دو برابر قیمت پایه اوپوس ۵ در پلتفرم کلود و از طریق اعتبارات استفاده در کلود کد در دسترس است.

در کنار اوپوس ۵، ما دو به‌روزرسانی را در نسخه بتا منتشر می‌کنیم:

  • تغییرات ابزار در حین مکالمه در پلتفرم کلود. در یک مکالمه، توسعه‌دهندگان اکنون می‌توانند ابزارهایی را که کلود می‌تواند استفاده کند، بدون باطل کردن حافظه پنهان درخواست، تغییر دهند.
  • بازگشت خودکار در API. کاربران اکنون می‌توانند انتخاب کنند که درخواست‌هایی که توسط دسته‌بندی‌کننده‌های ایمنی ما در اوپوس ۵ (یا فیبل ۵) پرچم‌گذاری می‌شوند، به طور خودکار به مدل دیگری هدایت شوند. با فعال بودن بازگشت خودکار، درخواست‌های API همیشه به طور پیش‌فرض به بهترین مدل موجود هدایت می‌شوند و مسدود نمی‌شوند.

مطابق با مدل‌های قبلی اوپوس، اوپوس ۵ الزامات حفظ داده برای دسترسی عمومی ندارد.

برای راهنمایی بیشتر در مورد چگونگی بهره‌برداری حداکثری از اوپوس ۵، به راهنمای درخواست‌نویسی ما مراجعه کنید.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: anthropic.com