ما در حال معرفی Claude Opus 5.5 به عنوان نخستین مدل از خانواده جدید Claude 5.5 هستیم. این مدل در اغلب وظایف همسطح Claude Fable 5.1 عمل میکند و هزینه اجرای آن ۴۰ درصد کمتر از Opus 5 است.
مدل Claude Opus 5.5 نخستین محصول ما پس از ارائه پیشنهاد تنظیم شتاب پیشرفت هوش مصنوعی پیشرو (pacing the frontier) به شمار میرود. این مدل پیش از انتشار عمومی توسط ارزیابهای مستقل از جمله Frontier Design و METR مورد آزمون قرار گرفت. در ارزیابی رفتاری خودکار ما — که جامعترین آزمون ترازسازی ارزیابیشده در این شرکت است — مدل Opus 5.5 قدرتمندترین عملکرد ثبتشده تا به امروز را از خود نشان داد. این مدل همچنین به تدابیر حفاظتی ویژهای مجهز است که پیشتر برای توانمندترین مدلهای خود توسعه داده بودیم.
برخی از بهبودهایی که در Opus 5.5 مشاهده خواهید کرد عبارتند از:
عملکرد. مدل Opus 5.5 یک جهش چشمگیر نسبت به Opus 5 محسوب میشود. این مدل اکنون پیشگام بازار است و آزمایشکنندگان اولیه شاهد جهشهای بزرگ عملکردی در پیچیدهترین پروژههای خود بودهاند. یکی از این آزمایشکنندگان توانست پروژه مهاجرت یک کدبیس ۶۸۰ هزار خطی را ظرف کمتر از یک روز به پایان برساند؛ پروژهای که تکمیل آن برای یک تیم مهندسی هفتهها زمان میبرد. این مدل در شناسایی و رفع ناکارآمدیها در نرمافزار مهارت بالایی دارد: هنگامی که از آن خواستیم زمان بارگذاری تمامی صفحات یک وباپلیکیشن را کاهش دهد، Opus 5.5 در ۳۹ مورد از ۴۰ آزمون موفق شد، در حالی که Opus 5 اصلاحات جزئیتری انجام داد که به تغییر رفتار برنامه نیز منجر شد. یک آزمایشکننده دیگر از چندین مدل مختلف Claude خواست که صرفاً با یک پرامپت یک بازی بسازند؛ در این آزمون Opus 5.5 به لطف کیفیت گرافیک و صیقلخوردگی نهایی محصول، بالاترین امتیاز را میان تمام مدلها کسب کرد.
ایمنی. مدل Opus 5.5 در آزمون خودکار ارزیابی رفتاری ما — مجموعه آزمونهای ترازسازی که عملکرد Claude را در هزاران سناریوی شبیهسازیشده میسنجد — بهترین امتیاز ثبتشده را در میان تمامی مدلها تا به امروز به دست آورده است. احتمال انجام اقدامات غیرقابل بازگشت یا فعالیت خارج از چارچوبهای تعیینشده توسط این مدل، در مقایسه با مدلهای پیشین بسیار کمتر است و در برابر حملات تزریق پرامپت (prompt injection) نیز مقاومت بیشتری نسبت به Opus 5 دارد. ما همچنین آزمونهای ترازسازی خود را گسترش دادهایم تا وظایف طولانیتر، وظایف غیرممکن و سناریوهای الگوبرداریشده از حوادث واقعی را پوشش دهد؛ اگرچه این مدل همچنان محدودیتهایی دارد. جزئیات کامل این ارزیابیها در شناسنامه سیستم Opus 5.5 (System Card) در دسترس است.
از آنجا که توانمندی Opus 5.5 در حوزههای زیستشناسی و امنیت سایبری همرده با Claude Mythos 5.1 است، این مدل را با تدابیر حفاظتی مشابه Claude Fable 5.1 عرضه میکنیم. سازمانهای تأییدصلاحیتشده میتوانند از امروز برای استفاده از Opus 5.5 در تحقیقات زیستشناسی، در برنامه تأیید علوم زیستی ثبتنام کنند. در هفتههای آتی نیز دسترسی به برنامه تأیید سایبری را گسترش خواهیم داد و متخصصان احرازهویتشده امنیت سایبری قادر خواهند بود از Opus 5.5 در پروژههای خود استفاده نمایند.
هزینه و سرعت. اجرای مدل Opus 5.5 در مقایسه با Opus 5 به منابع محاسباتی کمتری نیاز دارد و این موضوع در قیمتگذاری آن بازتاب یافته است. آزمونهای ما نشان میدهند که در تنظیمات پیشفرض، هزینه اجرای آن در بارهای کاری معمول ۴۰ درصد کمتر از Opus 5 خواهد بود. قیمت توکنهای ورودی و خروجی به ترتیب ۴ و ۲۰ دلار به ازای هر یک میلیون توکن تعیین شده که ۲۰ درصد کمتر از Opus 5 است. خواندن از حافظه موقت (Cache reads) — که بخش عمدهای از هزینههای توسعه مبتنی بر عامل (agentic) و کدنویسی را شامل میشود — به ۰.۲۰ دلار به ازای هر یک میلیون توکن رسیده که ۶۰ درصد کمتر از Opus 5 است. علاوه بر این، سرعت تولید خروجی در Opus 5.5 بیش از ۳۰ درصد سریعتر از Opus 5 است.
در کنار کاهش قیمتها، محدودیتهای استفاده ۵ ساعته در طرحهای Pro، Max و Team را نیز افزایش میدهیم. همچنین امکان بازنشانی محدودیت نرخ مصرف (rate limit reset) را برای کاربران دارای اشتراک فراهم کردهایم که میتوانند آن را ذخیره کرده و در هر زمان دلخواه به کار گیرند.
ارتباطات. مدل Opus 5.5 به شکلی بسیار طبیعیتر از مدلهای قبلی ارتباط برقرار میکند. آزمایشکنندگان اولیه لحن نگارش آن را واضحتر و درک آن را آسانتر دانستهاند؛ موضوعی که به یکی از پرتکرارترین بازخوردهای کاربران درباره Opus 5 پاسخ میدهد. این مدل مهمترین اطلاعات را در همان ابتدای متن ارائه میکند و سبک نگارش آن، این مدل را به همکار بهتری در جلسات طولانی کاری تبدیل میسازد. به تعبیر یکی از آزمایشکنندگان اولیه: «این مدل درست مثل خودم مینویسد.» در استفادههای درونسازمانی ما نیز این ویژگی بررسی و بازبینی خروجیهای Opus 5.5 را سادهتر کرده است که این امر علاوه بر مزایای کاربردی، یک امتیاز ایمنی نیز محسوب میشود.
مدلهای Claude Sonnet 5.5 و Claude Haiku 5.5 طی هفتههای آینده با همان بهبودهای عملکردی، بهرهوری و ایمنی عرضه خواهند شد.
عملکرد و مقرونبهصرفه بودن
بر اساس آزمونهای ارزیابی ما، مدل Claude Opus 5.5 در کدنویسی عاملمحور، استفاده از کامپیوتر و پردازش دانش در جایگاه نخست قرار دارد. با این حال، در این سطوح پیشرفته از توانمندی، متوجه شدهایم که تفاوتهای عددی در بنچمارکها معیار چندان دقیقی برای نمایش تفاوتهای دنیای واقعی نیستند. در ارزیابیهای درونسازمانی ما، فاصله میان Opus 5.5 و Claude Fable 5.1 کمتر از آن چیزی است که این نمرات نشان میدهند.
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| کدنویسی مبتنی بر عاملTerminal-Bench 4.0¹ | ۶۶.۴٪ | ۵۵.۸٪ | ۵۲.۳٪ | ۵۷.۹٪ | ۳۷.۳٪ |
| کدنویسی مبتنی بر عاملFrontierCode v1.1 (اصلی) | ۵۴.۴٪ | ۵۰.۳٪ | ۴۸.۰٪ | ۵۳.۳٪ | ۴۷.۵٪ |
| کدنویسی مبتنی بر عاملCursorBench 4.0 | ۵۷.۸٪ | ۵۱.۸٪ | ۴۶.۶٪ | — | ۴۱.۷٪ |
| کارهای مبتنی بر دانشGDPval-AA v2.1 | ۱۸۴۶ | ۱۷۳۵ | ۱۷۰۸ | ۱۵۴۲ | ۱۵۸۸ |
| جریانهای کاری تجاریAutomationBench² | ۴۰.۰٪ | ۳۱.۴٪ | ۲۶.۹٪ | ۴۱.۴٪ | ۲۸.۸٪ |
| استدلال چندرشتهایHumanity's Last Exam | ۶۷.۷٪همراه با ابزار | ۶۵.۶٪همراه با ابزار | ۶۳.۶٪همراه با ابزار | ۵۷.۲٪همراه با ابزار | — |
| پژوهشهای علمی مبتنی بر عاملTerminal-Bench-Science 0.1³ | ۵۸.۷٪ | ۵۲.۶٪ | ۲۹.۰٪ | ۶۴.۶٪ | ۲۲.۴٪ |
| استفاده از رایانهOSWorld 2.0 | ۸۱.۸٪نسبی | ۸۰.۷٪نسبی | ۷۴.۰٪نسبی | — | — |
| تشخیص نمودارهای بصریChartography | ۸۹.۰٪همراه با ابزار | ۸۸.۴٪همراه با ابزار | ۸۳.۴٪همراه با ابزار | — | — |
به جز مواردی که ذکر شده، تمام نتایج Claude Opus 5.5 با قابلیت تفکر تطبیقی در حداکثر توان پردازشی بهدست آمده است. نتایج Terminal-Bench 4.0 برای Claude Opus 5.5 در سطح پردازشی بسیار بالا (xhigh effort) و برای GPT-6 Astra در سطح پردازشی بالا طبق گزارش OpenAI ثبت شده است؛ این ارقام نشاندهنده بالاترین امتیاز هر مدل است. مدل Claude Opus 5.5 با فعال بودن کامل تدابیر حفاظتی محیط پروداکشن ارزیابی شد. در هنگام مداخله این تدابیر حفاظتی، وظایف مربوط به امنیت سایبری توسط Claude Opus 4.8 و وظایف زیستشناسی و توسعه مدلهای زبانی پیشرو توسط Claude Opus 5 انجام شد که این موضوع احتمالاً نمرات عملکردی Claude Opus 5.5 را در این بنچمارکها کاهش داده است.
1Terminal-Bench 4.0: خطای استاندارد برای Claude Opus 5.5 برابر ±۲.۶ امتیاز و برای سایر مدلهای Claude بین ±۱.۶ تا ۲ امتیاز است. در جدول ردهبندی عمومی (۵ بار آزمایش برای هر وظیفه با محیط Claude Code)، امتیاز مدل Claude Opus 5 برابر با ۵۱.۸٪ گزارش شده که سامانه آزمایشی ما آن را در حد خطای آزمایشی، ۵۲.۳٪ بازتولید کرده است. ارقام GPT-6 Astra و GPT-5.6 Sol بر اساس گزارش شرکت OpenAI درج شدهاند.
2AutomationBench: نتایج این ارزیابی توسط شرکت Zapier اجرا و گزارش شده است. این آزمونها بدون مدلهای جایگزین (fallback) انجام شدند؛ بنابراین مداخله تدابیر حفاظتی به منزله عدم موفقیت تلقی شد و این امر به ثبت نمرهای پایینتر از توان واقعی Claude Opus 5.5 در محیط عملیاتی انجامید. نتایج Claude Opus 5.5 از ارزیابیهای اختصاصی Zapier در دوره دسترسی زودهنگام استخراج شده است. نتایج مدلهای Opus 5، GPT-5.6 Sol و GPT-6 Astra نیز از جدول عمومی Zapier برگرفته شدهاند.
3Terminal-Bench-Science 0.1: خطای استاندارد برای هر مدل ±۳.۵ تا ۵ امتیاز است. در ردهبندی عمومی (۳ بار آزمایش برای هر وظیفه با محیط Claude Code)، امتیاز مدل Claude Opus 5 برابر ۳۰.۰٪ ثبت شده است که سامانه آزمایشی ما آن را در حد خطای آزمایشی، ۲۹.۰٪ بازتولید کرد. آمار GPT-6 Astra بر پایه گزارش OpenAI قید شده است.
مزیت بزرگ و آشکار Opus 5.5 در بهرهوری و کارایی آن نهفته است. این مدل به ازای هر توکن هزینه کمتری نسبت به Opus 5 دارد و توکنهای کمتری را برای هر وظیفه مصرف میکند؛ مزیتی که در مجموع به افت ۴۰ درصدی هزینهها منتهی میشود.
قیمتگذاری
| قیمت به ازای هر ۱ میلیون توکن | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| خواندن از کش (Cache reads) | $۰.۲۰ | $۰.۵۰ |
| توکنهای ورودی | $۴ | $۵ |
| توکنهای خروجی | $۲۰ | $۲۵ |
| نوشتن در کش (Cache writes) | $۵ | $۶.۲۵ |
حالت سریع (Fast mode) برای Opus 5.5 در پلتفرم Claude Code و بستر توسعه Claude با سرعتی تا ۲.۵ برابر بیشتر فعال است. قیمت این حالت برای هر یک میلیون توکن ورودی ۸ دلار و برای هر یک میلیون توکن خروجی ۴۰ دلار است.
کدنویسی
مدل Opus 5.5 به ویژه در پروژههای طولانی و حجیم نظیر ممیزی و مهاجرت کل کدبیسها عملکردی فوقالعاده دارد. یکی از آزمایشکنندگان اولیه از این مدل برای ممیزی و رفع ایرادات یک کدبیس ۲۰۰ هزار خطی در کمتر از سه ساعت استفاده کرد؛ در حالی که انجام همین کار با Opus 5 بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد. در یک آزمون داخلی، از Opus 5.5 و Fable 5.1 خواستیم نرمافزار پرکاربرد HAProxy را که وظیفه توزیع بار ترافیک وب روی سرورها را بر عهده دارد، از زبان C به Rust بازنویسی کنند. هر دو بازنویسی تقریباً تمام آزمونهای رگرسیون داخلی HAProxy را با موفقیت پشت سر گذاشتند، اما Opus 5.5 این فرآیند را به جای ۱۲ ساعت (در Fable 5.1) در ۹.۵ ساعت و با ۵۱ درصد هزینه کمتر به اتمام رساند.
مدل Opus 5.5 در حوزه کدنویسی مبتنی بر عامل، نتایجی همتراز پیشرفتهترین ابزارهای روز را با کسری از هزینههای معمول به ارمغان میآورد. این مدل در بنچمارک FrontierCode با سطح تلاش پردازشی پیشفرض، مدل GPT-6 Astra را با هزینهای در حدود یکپنجم (۲۰ درصد) به ازای هر وظیفه شکست میدهد. در بنچمارک Terminal Bench 4.0 با حدود ۴۰ درصد هزینه با Astra برابری میکند و در CursorBench نیز با حدود یکسوم هزینه، ۱۱ امتیاز بالاتر از GPT-5.6 Sol به دست میآورد.
بنچمارک Terminal-Bench 4.0 میزان موفقیت یک مدل در تکمیل وظایف تخصصی، پیچیده و چندمرحلهای را در محیط خط فرمان (CLI) ارزیابی میکند. مدل Opus 5.5 با توان پردازشی پیشفرض، مدل Opus 5 را در حداکثر توان پردازشی با حدود یکپنجم هزینه شکست میدهد و با حدود ۴۰ درصد هزینه با GPT-6 Astra برابری میکند.
آزمایشکنندگان اولیه ما نیز گزارشهای مشابهی از افزایش هوشمندی و بهرهوری ارائه کردهاند:
«توسعهدهندگان خواهان مدلهای عاملی هستند که بتوانند کارهای واقعی مهندسی نرمافزار را بر عهده بگیرند و به پایان برسانند. در ارزیابیهای ما در محیطهای GitHub Copilot CLI و VS Code، مدل Claude Opus 5.5 از حیث کمترین تعداد توکن و گامهای اجرایی ثبتشده جزو بهترینها بود. این مدل در VS Code وظایف بیشتری را در ترمینال با کمتر از نیمی از گامهای موردنیاز Opus 5 حل کرد. این مدل نه تنها بازدهی وظایف فردی را ارتقا میدهد، بلکه دستیابی به اهداف بزرگتر پروژههای توسعهدهندگان را نیز امکانپذیرتر میسازد.»
امنترین عامل کدنویسی
سازمانهایی که از عاملهای خودمختار در سامانههای خود استفاده میکنند، باید مطمئن باشند این عاملها دقیقاً طبق برنامه عمل میکنند؛ به ویژه زمانی که ساعتها بدون نظارت انسانی به فعالیت میپردازند. مدل Opus 5.5 به یک طبقهبندیکننده (classifier) مجهز است که پیش از اجرای هر اقدام آن را غربالگری میکند، دارای یک محیط آزمایشی ایزوله (sandbox) منبعباز است که تیمهای امنیتی میتوانند آن را ممیزی کنند، و از قابلیت بازبینی کدی بهره میبرد که آسیبپذیریها را پیش از ادغام نهایی شناسایی میکند.
خود این مدل نیز از لایههای دفاعی مستحکمتری برخوردار است. در برابر حملات تزریق پرامپت (prompt injection)، این مدل در تمامی سناریوهای مورد آزمایش ما شامل کدنویسی، کار با ابزارها، کار با کامپیوتر و وبگردی، همسطح یا برتر از Opus 5 عمل کرده است. در بنچمارک اجراشده توسط شرکت امنیت هوش مصنوعی Gray Swan، مدل Opus 5.5 همراه با Fable 5.1 کمترین میزان موفقیت حملات تزریق پرامپت را در میان تمامی مدلهای مورد آزمایش به خود اختصاص داده است.
کارهای مبتنی بر دانش
مدل Opus 5.5 یک پژوهشگر دقیق و اتکاپذیر است. در یک ارزیابی درونسازمانی، از مدلهای Opus 5.5، Fable 5.1 و Opus 5 خواستیم گزارشی از عملکرد سهماهه یک شرکت را تنها با استفاده از اطلاعات موجود در یک نسخه شبیهسازیشده از وب — که دسترسی به گزارش درآمدها در آن دشوار بود — تهیه کنند. یک سیستم ارزیاب خودکار تمامی آمارها و نقلقولها را با منابع تطبیق داد. در سطوح مختلف پردازشی، ۱۶ گزارش از ۱۸ گزارش ارائهشده توسط Opus 5.5 حدنصاب کیفی ما را کسب کردند؛ استانداردی که هرگونه عدد یا نقلقول ساختگی موجب رد آن میشد. در مقابل، هیچیک از مدلهای Fable 5.1 یا Opus 5 در هیچ تلاشی موفق به عبور از این فیلتر نشدند.
این مدل در تحلیلهای مالی و کارهای تجاری نیز قدرتمند ظاهر شده است. صندوق سرمایهگذاری Walleye Capital به عنوان یکی از آزمایشکنندگان اولیه گزارش داد که Opus 5.5 در پایینترین سطح پردازشی توانست عمده آزمونهای ارزیابی آنها را حل کند؛ در سطوح پردازشی بالاتر حتی فراتر رفت و متوجه خطایی در دستورالعملهای ارزیابی شد و آن را اصلاح کرد — خطایی که هیچ مدل دیگری پیش از این موفق به کشف آن نشده بود.
در آزمایشی دیگر، به هر دو مدل Opus 5.5 و Opus 5 وظیفه تحلیل طرح ادغام دو شرکت فرضی در حوزه نرمافزارهای منابع انسانی محول شد. هر مدل یک الگوی مالی در نرمافزار اکسل طراحی کرد و سپس آن را به یک ارائه مدیریتی در خصوص توجیهپذیری اقتصادی این معامله تبدیل نمود. هر دو مدل به نتایج یکسانی دست یافتند، اما مدل طراحیشده توسط Opus 5.5 جامعتر و ارائه آن خواناتر بود، در حالی که گزارش Opus 5 خطاهای جزئی داشت. علاوه بر این، Opus 5.5 این فرآیند را به جای ۹۳ دقیقه در ۶۳ دقیقه و با ۵۰ درصد هزینه کمتر به سرانجام رساند.
در ارزیابیهای مربوط به کارهای مبتنی بر دانش، Opus 5.5 با وجود مصرف توکنهای کمتر، عملکردی برتر از سایر مدلها نشان میدهد. در بنچمارک GDPval-AA v2.1 که ارزیابیکننده وظایف شغلی واقعی در ۴۴ حرفه مختلف است، Opus 5.5 به امتیاز Elo ۱۸۴۶ دست یافت که فراتر از نمرات Fable 5.1 و Opus 5 است. در سطح تلاش پیشفرض (متوسط)، Opus 5.5 مدل GPT-6 Astra را در حداکثر توان پردازشی، با حدود یکپنجم هزینه به ازای هر وظیفه پشت سر میگذارد. این مدل در بنچمارکهای سنجش جریانهای کاری تجاری و جمعآوری دادهها در مقیاس وسیع نیز دست برتر را داشته است.
شاخص GDPval-AA v2.1 از مؤسسه Artificial Analysis عملکرد عاملهای هوشمند را در امور تخصصی واقعی در ۴۴ شغل مختلف میسنجد. در بالاترین سطح توان پردازشی، Opus 5.5 نمره ۱۸۴۶ Elo را کسب کرده، در حالی که Fable 5.1 به نمره ۱۷۳۵ و Opus 5 به ۱۷۰۸ دست یافتهاند. در سطح پیشفرض (متوسط)، Opus 5.5 مدل GPT-6 Astra را در بالاترین توان پردازشی با حدود یکپنجم هزینه شکست میدهد.
مشتریان ما نیز نتایج مشابهی را گزارش کردهاند. در ادامه دیدگاه آنان را درباره تجربه همکاری با این مدل میخوانید:
«پاسخهای طولانی و غیرقابل پیگیری همواره بزرگترین چالش من با مدلهای پیشرو بوده است و Claude Opus 5.5 این معضل را برطرف میکند. این مدل مانند یک همکار کاربلد مینویسد و از قوانین نگارشی ما پیروی میکند. یک پیشنویس فنی بدون نیاز به ویرایشهای اساسی قابل استفاده بود و زمانی که یکی از پرامپتهای ما را بازنویسی کرد، نسخه آن را به نسخه خودم ترجیح دادم. هنگامی که مجموعه آزمونهای ما را بهینهسازی کرد، استدلالهای آن را به سادگی متوجه شدم و تغییرات را با اطمینان کامل وارد مرحله عملیاتی کردم.»
ارتباطات
ما ساختار نگارش و ارتباط کلامی Opus 5.5 را بهطور بنیادین متحول کردهایم؛ حوزهای که بیشترین بازخوردها و انتقادها را درباره Opus 5 به خود اختصاص داده بود. پیامهای مدل جدید با یک نگاه قابل درک هستند؛ خصیصهای که به گفته آزمایشکنندگان، بازدهی جلسات طولانی کاری را افزایش میدهد. این مدل اطلاعات کلیدی را در ابتدای متن قرار میدهد، کمتر از اصطلاحات تخصصی پیچیده استفاده میکند و اصول نگارشی دیکتهشده از سوی کاربر را با دقت رعایت مینماید. ما معتقدیم این رویکرد Opus 5.5 را به همکاری بسیار مطلوبتر بدل میسازد. در ادامه مقایسه عملکرد دو مدل در یک نمونه مشخص ارائه شده است:
لطفاً این مشکل را برای من توضیح بده.
آنچه یافتم
افت مازاد مربوط به طرح رایگان نیست — بلکه یک رگرسیون در کامیت 0552feb (با عنوان «استخراج مرزهای دوره صورتحساب در periods.py» و برچسب «بدون تغییر در رفتار») است.
باگ موجود
تابع aggregate.monthly_usage پیشتر از یک بازه نیمهباز استفاده میکرد:
start, end = month_start(year, month), next_month_start(year, month) if start <= e.ts < end:اما اکنون اینگونه عمل میکند:
if period.contains(e.ts)و در فایل periods.py:
@property def last_day(self) -> datetime: return next_month_start(...) - timedelta(days=1) # 2026-08-31 00:00:00 UTC def contains(self, ts): return self.first_day <= ts <= self.last_dayمتغیر last_day یک datetime در نقطه نیمهشب است، نه یک روز کامل. کسر کردن یک روز از ساعت ۰۰:۰۰ یکم سپتامبر، زمان ۰۰:۰۰ روز ۳۱ اوت را میدهد و چون مقایسه شامل خود مقدار (inclusive) است، دوره در عمل در همان لحظه آغازین روز سیویکم خاتمه مییابد. بنابراین هر رویدادی که مهر زمانی آن پس از نیمهشبِ آخرین روز ماه باشد نادیده گرفته میشود — یعنی تقریباً یک روز مصرف به ازای هر حساب در هر ماه.
فایل جدید test_periods.py متوجه این خطا نمیشود، زیرا فقط last_day.date() را بررسی میکند (که بهدرستی 2026-08-31 است) و contains را در ساعات ۰۰:۰۰ یکم اوت، ۱۲:۰۰ پانزدهم اوت، ۲۳:۵۹ سیویکم ژوئیه و ۰۰:۰۰ یکم سپتامبر تست میکند — و هرگز طول روز سیویکم را آزمایش نمیکند.
لطفاً این مشکل را برای من توضیح بده.
افت مازاد ناشی از یک باگ در بازنویسی کد (Refactor) سیستم صورتحساب است
تغییرات طرح رایگان تنها ۱.۵۰ دلار از افت درآمد شرکت acme در ماه اوت را توضیح میدهد. ۹.۹۲ دلار باقیمانده ناشی از یک باگ در کامیت 0552feb است. این کامیت با عنوان «بدون تغییر در رفتار» ثبت شده، اما محاسبه میزان مصرف در آخرین روز ماه را متوقف کرده است.
آنچه تغییر کرده است
پیش از ادغام (Merge)، فایل aggregate.py از یک بازه نیمهباز استفاده میکرد:
start <= e.ts < next_month_start(year, month) # [Aug 1 00:00, Sep 1 00:00)این تغییر، منطق مذکور را به Period.contains منتقل کرد و بازه را روی یک مرز نادرست بست:
last_day = next_month_start(...) - timedelta(days=1) # = 2026-08-31T00:00:00Z return self.first_day <= ts <= self.last_daylast_day یک مهر زمانی در ساعت نیمهشب است، نه یک روز کامل. بنابراین تمام رویدادهای پس از 2026-08-31T00:00:00Z حذف میشوند. دوره سپتامبر نیز از یکم سپتامبر آغاز میشود، در نتیجه این رویدادها در آن نیز محاسبه نمیشوند. این میزان مصرف به ماه دیگری منتقل نشده، بلکه اصلاً صورتحسابی برای آن صادر نشده است.
بازخورد دریافتی از مشتریان ما نیز مهر تأییدی بر این دستاوردهاست:
«خروجیهای طولانی و دشوار برای فهم، بزرگترین گلایه من از مدلهای پیشگام بود و Claude Opus 5.5 این مشکل را به کلی مرتفع ساخت. این مدل مانند یک همکار کارآزموده مینویسد و استانداردهای متنی ما را رعایت میکند. مشخصات طراحی تهیهشده توسط آن با حداقل ویرایش قابل پیادهسازی بود و وقتی یکی از پرامپتهای ما را بازنویسی کرد، نسخه ارائهشده توسط آن را به نسخه خودم ترجیح دادم. هنگامی که آزمونهای سیستمی ما را بهینهسازی کرد، به سادگی استدلالهایش را دنبال کردم و تغییرات را با اطمینان کامل به محیط عملیاتی فرستادم.»
ایمنی
تنظیم شتاب پیشرفت
هفته گذشته، داریو آمودی، مدیرعامل ما، تأکید کرد که شتاب پیشرفت هوش مصنوعی باید تنظیم و مدیریت شود تا اقدامات ایمنی همواره گامی جلوتر از قابلیتهای مدلها حرکت کنند. این راهبرد تضمینکننده امنیت هوش مصنوعی، حفظ رقابتپذیری با چین و تحقق مزایای هوش مصنوعی بهویژه در بخشهایی نظیر زیستشناسی و پزشکی است.
ما درک جامعی از ریسکهای مدلهای کنونی داریم و امکانات لازم برای مهار آنها را فراهم کردهایم. با این حال، همگام با افزایش توانمندیها ممکن است خطرات جدیتری به سرعت پدیدار شوند که باید از هماکنون برای مواجهه با آنها مهیا شویم. از این رو، اقدامات ایمنی ما به شکل همزمان در دو افق زمانی دنبال میشود:
اقدامات ایمنی برای مدلهای کنونی. نسل حاضر مدلها بر پایهای محکم از شیوههای تثبیتشده تکیه دارد: آزمونهای گسترده ترازسازی، ارزیابیهای پیش از انتشار توسط نهادهای ناظر مستقل نظیر METR و Frontier Design، و تعبیه سازوکارهای حفاظتی متناسب با سطح توانمندی هر مدل در بخشهای پرریسک مانند امنیت سایبری و زیستشناسی. ما این اقدامات را در هر انتشار ارتقا میدهیم و باور داریم که برای خنثیسازی شدیدترین ریسکهای مدلهای امروزی مناسب هستند و نمایی جامع — هرچند ناکامل — از خطرات جدی را پیش روی ما میگذارند.
همچنین ما توانمندی خود در آموزش و ارزیابی مدلهای همتراز را مورد پایش قرار داده و وضعیت مدلهای عمومی و درونسازمانی خود را در قالب گزارشهای ریسک تحت خطمشی توسعه مسئولانه (Responsible Scaling Policy) — چارچوب داوطلبانه ما برای مدیریت خطرات فاجعهبار هوش مصنوعی پیشرفته — منتشر میسازیم.
آمادگی برای مدلهای آینده. ما در حال آمادهسازی فرآیندهای آموزشی و سنجش خود برای میزبانی از مدلهای فوقپیشرفته نسل بعد هستیم. ما نحوه غربالگری محیطهای یادگیری تقویتی را سختگیرانهتر میکنیم، زیرا محیطهای معیوب عامل اصلی رفتارهای ناهماهنگ و ناتراز در هوش مصنوعی هستند. علاوه بر این، پاداشهای ترازسازی خود را بهبود بخشیده و در حال توسعه فرآیندهای خودکار برای شبیهسازی سناریوهای متنوع آموزش ایمنی هستیم. ما همچنین اقدامات امنیتی و پایش سیستم را تقویت میکنیم که تمرکز ویژه بر بهبود مانیتورینگ مبتنی بر تفسیرپذیری (interpretability) از جمله آنهاست؛ رویکردی که وابستگی ما به تحلیل زنجیره تفکر (chain-of-thought) مدل حین پردازش را کاهش خواهد داد.
مدلهایی با قابلیتهای بالاتر — مانند مدلهایی که میتوانند تمام فرآیند پژوهش هوش مصنوعی را به صورت خودکار انجام دهند — به استانداردهای ایمنی به مراتب سختگیرانهتری نیاز دارند. تأکید ما بر کنترل سرعت پیشرفت نیز تا حد زیادی ریشه در این پیشبینی دارد که چنین مدلهایی به زودی آموزش خواهند دید. برای این دست از مدلها، تدابیر فوق به تنهایی کافی نخواهند بود. با رشد توانمندیهای هوش مصنوعی، سیاستگذاریهای عمومی باید نقش برجستهتری در تضمین امنیت سامانهها ایفا کنند. ایجاد چنین زیرساختهایی نیازمند زمان است و ما همانطور که در بیانیه «باید شتاب پیشرفت را تنظیم کنیم» و همکاری اخیرمان با شرکت اکسنچر (Accenture) شرح دادیم، مقدمات آن را آغاز کردهایم. همچنین به مشارکت در مباحث سیاستگذاری با دولتها و فعالان صنعت در زمینه مقرراتگذاری و هماهنگیهای بینالمللی ادامه خواهیم داد.
ترازسازی (Alignment)
در مجموعه ارزیابی اصلی ما که رفتارهای Claude را در قالب حدود ۲,۰۰۰ سناریوی مختلف بررسی میکند، Opus 5.5 تقریباً در تمامی شاخصهای رفتارهای ناتراز، نمرهای بهتر از مدلهای پیشین Claude ثبت کرده است. این مدل همچنین در اغلب معیارهای سنجش صداقت، قویترین مدل ما محسوب میشود.
بهطور ویژه، Opus 5.5 در چندین رفتاری که در حوادث سایبری اخیر نقش داشتند، بهبود یافته است؛ رفتارهایی نظیر استدلالهای سوگیرانه یا جانبدارانه، تلاش برای فرار از محیط امن شبیهسازی (sandbox) و انجام اقدامات مخرب پس از پی بردن به حضور در محیط آزمایشی. در ارزیابی نوینی که برای سنجش تمایل مدل به عبور از مرزهای محصور طراحی شده، میزان تلاش Opus 5.5 برای دور زدن محدودیتها حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 بوده و تمام تلاشهای ثبتشده نیز خطراتی اندک داشته و توسط خود سیستم گزارش شده است. برای تیمهایی که قصد دارند Claude را بدون نظارت مستقیم انسانی روی کدبیسها و سامانههای خود به کار گیرند، این ویژگی به اندازه توان محاسباتی اهمیت دارد.
با این حال، همانطور که در گزارش اخیر خود درباره ارزیابی ترازسازی شرح دادیم، ایجاد آزمونهایی که تمام خطاهای احتمالی را پیش از پیادهسازی شناسایی کنند، همچنان مسئلهای حلنشده در علم هوش مصنوعی است. شواهد نشان میدهد Opus 5.5 در موارد متعددی متوجه میشود که در حال ارزیابی شدن است؛ امری که ارزیابی عملکرد واقعی آن در شرایط استقرار در محیطهای گوناگون جهان واقعی را با چالش مواجه میکند. ما انتظار داریم با گسترش این محیطها و تقویت هوش مدلها، این چالش پررنگتر شود مگر آنکه در زمینه تفسیرپذیری به پیشرفتهای نوینی دست یابیم. با وجود اطمینان از پیشرفتهای گسترده Opus 5.5، ما اقدامات ترازسازی خود را با تدابیر حفاظتی زیر همراه ساختهایم.
تدابیر حفاظتی
با افزایش توانمندی مدلها، پیادهسازی پروتکلهای حفاظتی سختگیرانهتر یکی از راهکارهای ما برای جلوگیری از سوءاستفاده از این فناوری است. مدل Opus 5.5 نخستین عضو از خانواده Opus است که همراه با سطح حفاظتی مشابه Fable 5.1 در حوزههای امنیت سایبری، زیستشناسی و تقطیر دانش (distillation) عرضه میشود و در صورت بروز مغایرت، فرآیند پردازش را به شکلی شفاف به مدلی دیگر منتقل میکند.
امنیت سایبری. با توجه به قابلیتهای سایبری فوقالعاده قدرتمند Opus 5.5، لایههای حفاظتی سایبری مشابه با Fable 5.1 را روی آن اعمال کردهایم. کاربران میتوانند طبق روال معمول چرخه توسعه نرمافزار، باگهای موجود در کدهای خود را شناسایی و برطرف کنند، اما اغلب وظایف تخصصی امنیت سایبری به مدل Opus 4.8 هدایت خواهند شد.
برای مدافعان سایبری، به زودی برنامه اعتبارسنجی سایبری را برای پوشش مدل Opus 5.5 گسترش خواهیم داد. این برنامه جدید شامل سه لایه دسترسی مطمئن از جمله دسترسی به مدلهای Claude Mythos خواهد بود. سرویس Claude Security نیز هماکنون با دسترسی به Claude Mythos 5.1 فعال است.
زیستشناسی. مدل Opus 5.5 در حوزه زیستشناسی از تواناییهای بالایی برخوردار است، به گونهای که عملکردی فراتر از Opus 5 نشان داده و در حوزههای متعدد کاری با Claude Mythos 5.1 برابری میکند یا از آن پیشی میگیرد. به عنوان نمونه، این مدل در ارزیابی طراحی و پیشبینیهای بلندمدت مولکولی — که با همکاری Dyno Therapeutics انجام شد — نتایج نوآورانهای ثبت کرد و متخصصان آزمونهای نفوذ (red-teamers)، نوآوری علمی آن را همرده با بهترین مدلهای آزمودهشده ارزیابی کردند.
به همین جهت، Opus 5.5 از سازوکارهای حفاظتی زیستشناسی مشابه با Fable 5.1 بهره میبرد. کاربرانی که نیازمند عبور از این محدودیتها برای مقاصد پژوهشی و توسعه هستند، میتوانند در برنامه تأیید علوم زیستی ثبتنام کنند تا سازمانهای احرازهویتشده نظیر مراکز دانشگاهی، استارتاپها و شرکتهای داروسازی به دسترسیهای ویژه مجهز شوند. متقاضیان میتوانند از اینجا اقدام به ثبتنام نمایند.
تقطیر دانش (Distillation)
حملات تقطیر — که در آنها نفوذگران با استفاده از هزاران حساب جعلی اقدام به استخراج توانمندیهای مدل در مقیاس صنعتی میکنند — مخاطرات جدی امنیتی و ملی به دنبال دارند. این شیوه به افراد مخرب اجازه میدهد مدلهایی فوقالعاده توانمند را بدون لایههای ایمنی کلود بازتولید کنند. گزارش هشدارهای امنیتی سپتامبر ۲۰۲۶ جزئیات فعالیتهای غیرمجاز تقطیر را که تاکنون ردیابی و مهار کردهایم، تشریح میکند.
مدل Opus 5.5 همراه با قابلیت «حفظ تفکر» (preserved thinking) — سازوکار ضد تقطیر معرفیشده در Fable 5.1 — عرضه میشود. این قابلیت مانع از آن میشود که کاربران API با دستکاری بافت و سوابق قبلی پیامها، ساختار استدلال درونی کلود را استخراج نمایند. این ضابطه برای Fable 5.1 و Opus 5.5 و برای تمامی حسابهای API ایجادشده از تاریخ ۳۱ اوت ۲۰۲۶ به بعد اعمال میشود. جزئیات این تغییر در مقاله مرکز راهنما و نحوه آزمایش آن در مستندات حفظ تفکر ارائه شده است.
حفظ دادهها و انطباق با قوانین
همانند مدلهای پیشین سری Opus، مدل Opus 5.5 نیز با خطمشی عدم ذخیرهسازی دادهها (zero data retention) ارائه میشود.
مشابه با Fable 5.1، این مدل با راهکارهای درج نشان پنهان (watermarking) به منظور پایبندی به قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) سازگار است که شرح آن در اینجا آمده است. همچنین امکان غیرفعالسازی حالت «تفکر» در این مدل وجود ندارد که توضیحات تکمیلی آن در این بخش قابل مشاهده است.
دسترسی
مدل Claude Opus 5.5 اکنون در تمامی بسترهای ابری شامل آمازون وب سرویسز (AWS)، گوگل کلود و مایکروسافت آژور در دسترس است. توسعهدهندگان نیز میتوانند از طریق پلتفرم کلود و با شناسه claude-opus-5-5 کار با این مدل را آغاز کنند.