اشتراک
فناوری هوش مصنوعی اخبار محصول

کلود سانت ۵.۵

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

کلود سانت ۵.۵، دومین مدل از خانواده کلود ۵.۵، معرفی شده است که نسبت به سانت ۵ بیش از ۳۰ درصد سریع‌تر و تا ۳۰ درصد کم‌هزینه‌تر است. این مدل مکملی سریع و کم‌هزینه برای اوپوس ۵.۵ محسوب می‌شود؛ جایی که اوپوس برای کارهای پیچیده با نیاز به قضاوت دقیق ساخته شده، سانت ۵.۵ در وظایف روزمره، رفع اشکال، تولید اسناد و طراحی قوی‌ترین است. در ترمینال-بنچ ۴.۰ امتیاز ۷۰.۶ درصد در مقابل ۱۰.۳ درصد سانت ۵ کسب کرده و در کارهای بلندمدت و درک تصویر نیز پیشرفت چشمگیری داشته است. آزمایش‌کنندگان اولیه آن را شریکی بهتر برای همکاری توصیف کردند. قیمت آن مانند سانت ۵ است (۲ دلار ورودی، ۱۰ دلار خروجی و ۰.۲۰ دلار حافظه پنهان به ازای هر میلیون توکن)، اما به توکن‌های کمتری نیاز دارد و هزینه هر وظیفه تا ۳۰ درصد کمتر است. در ممیزی هم‌راستایی و ایمنی، سانت ۵.۵ بهبود یافته یا برابر با سانت ۵ است و نخستین مدل سانت محسوب می‌شود که با تدابیر حفاظتی سایبری مشابه مدل‌های توانمندتر عرضه می‌شود. در کدنویسی جهش محسوسی داشته و در GDPval-AA تقریباً هم‌سطح اوپوس ۵.۵ است. سانت ۵.۵ هم‌اکنون در همه پلتفرم‌ها از جمله AWS، گوگل کلود و مایکروسافت آژور با نگهداری صفر داده در دسترس است و توسعه‌دهندگان می‌توانند کار خود را با شناسه claude-sonnet-5-5 آغاز کنند. کلود هایکو ۵.۵ نیز در هفته‌های آینده به این خانواده می‌پیوندد.

,

کلود سانت ۵.۵ را معرفی می‌کنیم؛ دومین مدل از خانواده کلود ۵.۵. این مدل ارتقایی آشکار نسبت به کلود سانت ۵ است، بیش از ۳۰ درصد سریع‌تر اجرا می‌شود و برای بیشتر کارها تا ۳۰ درصد هزینه کمتری دارد.

سانت ۵.۵ مکملی سریع‌تر و کم‌هزینه‌تر برای کلود اوپوس ۵.۵ است. جایی که اوپوس ۵.۵ برای کارهای پیچیده‌ای ساخته شده که به قضاوت دقیق نیاز دارند، سانت ۵.۵ در وظایف روزمره با دامنه مشخص، رفع اشکال و تولید اسناد، اسلایدها و صفحات گسترده‌ی صیقل‌خورده قوی‌ترین است. همچنین چشمی تیزبین برای طراحی دارد. کلود هایکو ۵.۵ که برای کاربردهای پرحجم و حساس به هزینه ساخته شده است، در هفته‌های آینده به خانواده کلود ۵.۵ می‌پیوندد.

,

سانت ۵.۵ نسبت به سانت ۵ در موارد زیر بهبود یافته است:

عملکرد. سانت ۵.۵ در ترمینال-بنچ ۴.۰، یک ارزیابی کدنویسی عاملی، امتیاز ۷۰.۶ درصد کسب می‌کند، در حالی که سانت ۵ امتیاز ۱۰.۳ درصد داشت. این مدل در GDPval-AA، آزمونی از کارهای دنیای واقعی در مشاغل گوناگون، دو امتیاز پایین‌تر از اوپوس ۵.۵ قرار می‌گیرد. همچنین در کارهای بلندمدت و درک تصویر قوی است؛ نخستین مدل سانت است که تنها با استفاده از تصاویر صفحه، بازی پوکمون رد را شکست می‌دهد.

همکاری. مانند اوپوس ۵.۵، سانت ۵.۵ شفاف‌تر از نسل پیشین مدل‌های ما می‌نویسد؛ آزمایش‌کنندگان اولیه آن را شریکی بهتر برای همکاری نسبت به سانت ۵ توصیف کردند. سرعت آن نیز آن را برای تکرار سریع در وظایف کم‌پیچیده مناسب می‌کند.

هزینه. قیمت سانت ۵.۵ مانند سانت ۵ است: ۲ دلار برای هر میلیون توکن ورودی، ۱۰ دلار برای هر میلیون توکن خروجی و ۰.۲۰ دلار برای هر میلیون توکن خوانده‌شده از حافظه پنهان؛ اما معمولاً برای انجام همان کار به توکن‌های بسیار کمتری نیاز دارد. در آزمون‌های ما، هزینه هر وظیفه آن تا ۳۰ درصد کمتر از نسل پیشین است.

سرعت. سانت ۵.۵ خروجی‌ها را بیش از ۳۰ درصد سریع‌تر از سانت ۵ تولید می‌کند و سریع‌ترین مدل سانت ما تا امروز است.

هم‌راستایی و ایمنی. در ممیزی رفتاری خودکار ما، سانت ۵.۵ در بیشتر سنجه‌های هم‌راستایی نسبت به سانت ۵ بهبود یافته یا با آن برابر است. چون توانمندی‌های امنیت سایبری آن با اوپوس ۵ قابل مقایسه است، نخستین مدل سانت است که با تدابیر حفاظتی و جایگزین‌های سایبری مشابه آنچه برای توانمندترین مدل‌هایمان توسعه داده‌ایم عرضه می‌شود. تدابیر حفاظتی زیستی آن همانند سانت ۵ است. هر دو تدبیر حفاظتی مجموعه‌ای محدود از درخواست‌های پرخطر را هدف می‌گیرند؛ توسعه نرم‌افزارهای معمول و بیشتر کارهای علوم زیستی تحت تأثیر قرار نمی‌گیرند.

عملکرد

سانت ۵.۵ در حوزه‌های گوناگون نسبت به سانت ۵ بهبود یافته است—در برخی موارد به‌شکل چشمگیر. در چند ارزیابی، سانت ۵.۵ با تلاش حداکثری حتی عملکردی قابل مقایسه با اوپوس ۵.۵ دارد. با این حال، امتیازهای محک تنها یک جنبه از توانمندی‌های مدل را نشان می‌دهند؛ در آزمون‌های خود ما و آزمایش‌کنندگان بیرونی، اوپوس ۵.۵ همچنان در کارهای پیچیده و باز که به قضاوت مستمر نیاز دارند، آشکارا قوی‌تر است.

,

نمودارهای زیر امتیاز هر مدل را در برابر هزینه هر وظیفه آن در هر سطح تلاش نشان می‌دهند. با افزایش تلاش، مدل‌ها معمولاً بیشتر کار می‌کنند که به هزینه بیشتر برای هر وظیفه می‌انجامد، اما عموماً امتیاز بالاتری نیز به همراه دارد. هرچه یک نقطه به گوشه بالا-چپ نمودار نزدیک‌تر باشد، توانمندی بیشتری به ازای هر دلار ارائه می‌دهد.

,

در چند محک، سانت ۵.۵ با تلاش کم یا متوسط بهترین امتیاز سانت ۵ را با حدود یک‌دهم هزینه هر وظیفه شکست می‌دهد. بهترین مکمل اوپوس ۵.۵ زمانی است که با تنظیمات تلاش پایین‌تر اجرا شود، جایی که هزینه هر وظیفه کمتری دارد. در تنظیمات بالاتر، می‌تواند با هزینه‌ای مشابه عملکردی قابل مقایسه داشته باشد.

ترمینال-بنچ ۴.۰ می‌سنجد که یک مدل چقدر می‌تواند وظایف حرفه‌ای پیچیده و چندمرحله‌ای را در یک رابط خط فرمان کامل کند. در تلاش متوسط، که پیش‌فرض در اپلیکیشن‌های کلود است، سانت ۵.۵ بهترین امتیاز سانت ۵ را با کمتر از یک‌دهم هزینه هر وظیفه پشت سر می‌گذارد.

ترمینال-بنچ و اوپن‌ای‌آی عملکرد GPT-6 Sol را به‌صورت عمومی گزارش نکردند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش می‌کنیم.

کدنویسی

جهش عملکرد سانت ۵.۵ به‌ویژه در کدنویسی محسوس است. در تلاش بالا روی فرانتیرکد، امتیاز آن ۱۰ امتیاز بالاتر از سانت ۵ در همان تنظیم است، با حدود یک‌پانزدهم هزینه هر وظیفه. در کرسوربنچ، که مدل‌ها را روی وظایف برگرفته از جلسات واقعی کدنویسی کرسور می‌آزماید، بهترین امتیاز آن تا حدود دو امتیاز به اوپوس ۵.۵ می‌رسد.

آزمایش‌کنندگان اولیه از سرعت درک سانت ۵.۵ از یک پایگاه کد قدردانی کردند. همچنین کارآمدی آن توجهشان را جلب کرد: در اجراهای رودررو، فراخوانی‌های ابزار را بیش از سانت ۵ دسته‌بندی می‌کرد که به گام‌های کمتر و هزینه‌های پایین‌تر می‌انجامید.

,

«در آزمون‌های اولیه اپیک، کلود سانت ۵.۵ همان استاندارد کیفی را که از یک مدل رده بالاتر انتظار دارید برآورده کرد و در ممیزی طراحی سیستم و بازبینی جریان داده مقاوم بود. مدل جدید ده‌ها هزار خط کد برای معماری سیستم گیم‌پلی را مدیریت کرد، پاسخ‌ها را سریع نگه داشت، وظایف چندساعته را انجام داد و با دستورهای کمتر تجویزی تحویل داد.»

اپیک گیمز — دانیل فوگل، مدیر ارشد عملیات

کار دانشی

سانت ۵.۵ در چند حوزه کار دانشی پیشرفت نشان می‌دهد. در GDPval-AA، که مدل‌ها را روی وظایف دنیای واقعی در ۴۴ شغل و ۹ صنعت اصلی می‌آزماید، سانت ۵.۵ تقریباً هم‌سطح اوپوس ۵.۵ و حدود ۴۰۰ امتیاز بالاتر از سانت ۵ امتیاز می‌گیرد. در استفاده از رایانه و تشخیص نمودار نزدیک به اوپوس ۵.۵ است و در کارهای دانشی بلندمدت آشکارا از سانت ۵ و GPT-6 Sol بهتر عمل می‌کند.

آزمایش‌کنندگان اولیه به بهبودهای کمتر قابل‌اندازه‌گیری اشاره کردند. آن‌ها آن را شریکی گفت‌وگویی طبیعی‌تر یافتند و به ذوق آن در طراحی اشاره کردند و یادآور شدند که به رابط‌های کاربری صیقل می‌بخشد و می‌تواند قالب‌های اسلاید را دنبال کند تا ارائه‌هایی بسازد که ویرایش کمینه نیاز دارند. در یک آزمون داخلی، مواد مالی سه‌ماهه و متن تماس‌های یک شرکت بورسی را همراه با یک قالب اسلاید به آن دادیم و خواستیم یک مرور عملیاتی ۱۰ اسلایدی بسازد. دو کارشناس پیش‌نویس اول آن را آماده ارسال بی‌کم‌وکاست دانستند.

,

«بدون تغییر هیچ‌یک از دستورهای ما، کلود سانت ۵.۵ در تقریباً همه ارزیابی‌های آفلاین اسلک‌بات ما بهتر از سانت ۵ عمل کرد، با گام‌های کمتر و حدود ۱۴ درصد توکن خروجی کمتر. وقتی کسی به اسلک‌بات وظیفه‌ای می‌سپارد، کیفیت و سرعت مهم‌ترین چیز است و سانت ۵.۵ به اسلک‌بات امکان می‌دهد نتایج بهتری را سریع‌تر برای کاربران فراهم کند.»

اسلک — کرتیس آلن، مهندس ارشد

هزینه و سرعت

سانت ۵.۵ برای هر وظیفه به توکن‌های کمتری از سانت ۵ نیاز دارد، بنابراین اجرای آن کم‌هزینه‌تر است. همچنین خروجی را بیش از ۳۰ درصد سریع‌تر تولید می‌کند و کارآمدی آن بی‌درنگ محسوس است:

,

تنظیم سطح تلاش به شما امکان می‌دهد هزینه و سرعت را در برابر کیفیت کلی متعادل کنید. در کلود کد و اپلیکیشن‌های ما، تلاش پیش‌فرض روی متوسط تنظیم شده است، در حالی که پلتفرم کلود پیش‌فرض را بالا قرار می‌دهد. در تنظیمات پایین‌تر، کلود سریع‌تر پاسخ می‌دهد و توکن کمتری مصرف می‌کند که برای کارهای روزمره مناسب است. در تنظیمات بالاتر، کلود طولانی‌تر استدلال می‌کند و کار خود را دقیق‌تر بررسی می‌کند.

ایمنی

هم‌راستایی

سانت ۵.۵ مرز توانمندی‌های مدل‌های ما را جابه‌جا نمی‌کند، بنابراین ارزیابی هم‌راستایی ما بر مجموعه‌ای هدفمند از خطرات متمرکز شد که به مدل‌های هر سطح توانمندی مربوط می‌شوند، از جمله اقدام علیه منافع کاربران، گمراه‌کردن کاربران و همکاری در سوءاستفاده پرخطر.

در ممیزی رفتاری خودکار ما، که کلود را در حدود ۱۸۵۰ سناریو می‌آزماید، سانت ۵.۵ در بیشتر سنجه‌های هم‌راستایی، مقاومت در برابر سوءاستفاده و صداقت نسبت به سانت ۵ بهبود یافته یا با آن برابر است. در ارزیابی‌های جدیدتر مهار ما، سانت ۵.۵ در اینکه به‌ندرت تلاش می‌کند از محیط محدود خود بگریزد به اوپوس ۵.۵، بهترین مدل آزمون‌شده ما، نزدیک می‌شود و از همه مدل‌های ما کمترین احتمال را دارد که محدودیت‌های ظرف خود را بکاود. در کل ممیزی، اوپوس ۵.۵ همچنان به‌طور کلی کمی بهتر عمل می‌کند، اما هیچ شاهدی نیافتیم که سانت ۵.۵ اهدافی مغایر با قصد کاربر را دنبال کند.

همان‌طور که در ارزیابی هم‌راستایی اخیر خود توضیح دادیم، هیچ مجموعه‌ای از ارزیابی‌ها به‌طور قابل‌اعتماد همه شکست‌ها را شناسایی نمی‌کند و ممکن است سانت ۵.۵ گرایش‌هایی داشته باشد که ما نیافته‌ایم؛ به همین دلیل کار هم‌راستایی خود را با تدابیر حفاظتی توصیف‌شده در زیر همراه می‌کنیم.

,

تدابیر حفاظتی

امنیت سایبری. توانمندی‌های سایبری سانت ۵.۵ بهبود بزرگی نسبت به سانت ۵ است، بنابراین آن را با تدابیر حفاظتی مشابه آنچه روی اوپوس ۵.۵ اعمال شده مستقر می‌کنیم. کاربران همچنان می‌توانند به‌عنوان بخشی از توسعه نرم‌افزارهای معمول، اشکالات کد خود را بیابند و رفع کنند، اما وظایف پرخطرتر امنیت سایبری به‌طور محسوس به سانت ۵ بازمی‌گردند. به‌زودی مدافعان سایبری می‌توانند برای دسترسی لایه‌ای به توانمندی‌های پیشرفته‌تر روی مدل‌های سانت ۵.۵، اوپوس ۵.۵ و کلود میتوس، به برنامه گسترده تأیید سایبری ما درخواست دهند.

زیست‌شناسی. سانت ۵.۵ از همان مجموعه تدابیر حفاظتی زیستی سانت ۵ استفاده می‌کند. این تدابیر درخواست‌های زیان‌بار را هدف می‌گیرند؛ بیشتر کارهای پژوهشی، آموزشی و بالینی تحت تأثیر قرار نمی‌گیرند، هرچند ممکن است برخی درخواست‌های میکروبیولوژی و ویروس‌شناسی به‌اشتباه علامت‌گذاری شوند. سازمان‌ها می‌توانند برای دسترسی به تدابیر حفاظتی طراحی‌شده برای تمام گستره کارهای مرتبط با زیست‌شناسی، به برنامه تأیید علوم زیستی ما درخواست دهند.

تقطیر. حملات تقطیر، که در آن مهاجمان با هزاران حساب جعلی توانمندی‌های یک مدل را در مقیاس صنعتی استخراج می‌کنند، به بدخواهان امکان می‌دهد مدل‌های بسیار توانمندی بدون تدابیر حفاظتی که در کلود تعبیه کرده‌ایم بسازند. چون سانت ۵.۵ بسیار توانمندتر از نسل پیشین خود است، نخستین مدل سانت است که با طبقه‌بندهای ایمنی برای جلوگیری از استخراج استدلال عرضه می‌شود. سانت ۵.۵ همچنین تفکر حفظ‌شده را گسترش می‌دهد تا تفکر کلود نتواند از حسابی که آن را ساخته جدا شود. بیشتر توسعه‌دهندگان تغییری متوجه نخواهند شد. اگر گفت‌وگوها را بین حساب‌ها منتقل می‌کنید، از جمله تغییر حساب در میانه جلسه در کلود کد، مقاله مستندات ما این تغییر را توضیح می‌دهد.

شروع کار

مانند اوپوس ۵.۵ و سانت ۵، کلود سانت ۵.۵ با نگهداری صفر داده در دسترس است.

کلود سانت ۵.۵ هم‌اکنون در همه پلتفرم‌ها، از جمله آمازون وب سرویسز، گوگل کلود و مایکروسافت آژور در دسترس است. توسعه‌دهندگان می‌توانند کار خود را در پلتفرم کلود با claude-sonnet-5-5 آغاز کنند. اگر سانت را با تفکر خاموش اجرا می‌کنید، باید پیش از رفتن به سانت ۵.۵ به تنظیم جدید between_tools سوئیچ کنید که تفکر پیش‌رو را خاموش نگه می‌دارد. برای جزئیات، راهنمای مهاجرت ما را ببینید.

پانویس‌ها

۱ نتایج ترمینال-بنچ ۴.۰ برای کلود اوپوس ۵.۵ با تلاش Xhigh گزارش شده است که بالاترین امتیاز مدل را نشان می‌دهد.

۲ سانت ۵.۵ در تلاش حداکثری امتیاز کمتری از Xhigh دارد. فرانتیرکد می‌سنجد که آیا یک تغییر کد می‌تواند بدون ویرایش انسانی ادغام شود. این محک تغییرات خارج از دامنه را جریمه می‌کند، حتی اگر باکیفیت یا مفید باشند. در تلاش حداکثری، سانت ۵.۵ بیشتر مهارت بازبینی کد کلود کد را اجرا می‌کرد که بازبینی را میان بسیاری از زیرعامل‌ها تقسیم می‌کند و در دو موردی که کاگنیشن بررسی کرد، این به وقفه زمانی یا ویرایش‌های اضافی فراتر از دامنه وظیفه و در نتیجه امتیاز پایین‌تر انجامید.

۳ آرتیفیشال آنالیزیس GDPval-AA و AA-Briefcase را روی استقرار پیش‌از‌عرضه سانت ۵.۵ در پلتفرم کلود اجرا کرد که ما در آن اشکالی یافتیم که می‌توانست پاسخ‌ها به درخواست‌های دارای خروجی ساختاریافته را تضعیف کند. انتظار داریم تأثیر آن بر امتیازهای سانت ۵.۵، اگر وجود داشته باشد، اندک باشد و عملکرد آن را کمتر از واقع نشان دهد. آن اشکال از آن زمان رفع شده است.

۴ اوپن‌ای‌آی اخیراً اشکالی را رفع کرد که درک تصویر در GPT-6 Sol را تضعیف می‌کرد. امتیازهای رسمی AA-Briefcase v1.1 و GDPval-AA v2.1 از آرتیفیشال آنالیزیس و امتیازهای Chartography از Surge AI ممکن است هنوز برای بازتاب آخرین نسخه مدل به‌روزرسانی نشده باشند. آرتیفیشال آنالیزیس انتظار تأثیرات عمده بر AA-Briefcase v1.1 و GDPval-AA v2.1 را ندارد. آزمون داخلی Chartography نشان می‌دهد امتیاز آن تحت تأثیر قرار نگرفته است.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: anthropic.com