اشتراک
هوش مصنوعی فناوری توسعه نرم‌افزار

کلود اپوس ۵.۵ در برابر اپوس ۵ در وظایف استدلالی: ارزان‌تر، سریع‌تر، اما نه بهتر

آنتروپیک می‌گوید اپوس ۵.۵ نسبت به اپوس ۵، ۴۰٪ ارزان‌تر و ۳۰٪ سریع‌تر است. در آزمون‌های دشوار استدلال، صرفه‌جویی هزینه تأیید شد، اما ادعای سرعت محقق نشد

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

آنتروپیک مدل کلود اپوس ۵.۵ را با ادعای عملکرد بهتر از اپوس ۵، هزینه ۴۰٪ کمتر و سرعت ۳۰٪ بیشتر معرفی کرده است. قیمت API نیز از ۵ و ۲۵ دلار به ۴ و ۲۰ دلار به ازای هر میلیون توکن ورودی و خروجی کاهش یافته که به‌تنهایی ۲۰٪ صرفه‌جویی را توضیح می‌دهد. برای ارزیابی این ادعاها، هر دو مدل در سه وظیفه استدلالی دشوار آزمایش شدند: جدول منطقی با ۲۲ سرنخ، مسئله ترتیب‌های محدود برای ۶ تا ۱۰ کار، و بازی سنگی با حافظه. در جدول منطقی، هر دو مدل پاسخ درست دادند، اما اپوس ۵.۵ با ۰٫۱۶ دلار در برابر ۰٫۲۷ دلار، ۴۳٪ ارزان‌تر بود. در مسئله ترتیب‌دهی، هیچ‌کدام پاسخی ندادند و اپوس ۵.۵ در اجرای دوم با محدودیت ۱۲۸ هزار توکن، به دلیل فیلتر ایمنی اشتباه رد شد. در بازی سنگی، هر دو درست پاسخ دادند و اپوس ۵.۵ با ۶۹٪ هزینه کمتر و ۶۲٪ توکن کمتر برنده شد. در مجموع، اپوس ۵.۵ حدود ۱۱٪ سریع‌تر بود که کمتر از ادعای ۳۰٪ آنتروپیک است، اما صرفه‌جویی هزینه‌ای واقعی محقق شد. بیشتر این صرفه‌جویی ناشی از مصرف کمتر توکن‌های خروجی است. نتیجه‌گیری اینکه مهاجرت از اپوس ۵ به ۵.۵ منطقی است، به شرط تعیین محدودیت سخت خروجی و نظارت بر هزینه در مسائل دشوار. برای مسائل شمارشی، بهتر است به مدل ابزار اجرای کد داده شود.

:

وقتی آنتروپیک کلود اپوس ۵.۵ را این هفته منتشر کرد، این شرکت ادعا کرد مدل جدید ۴۰٪ کمتر از اپوس ۵ هزینه دارد و خروجی را ۳۰٪ سریع‌تر تولید می‌کند. بازاریابی آنتروپیک سه ادعا مطرح می‌کند: اپوس ۵.۵ در سطح کلود فابل ۵.۱ عمل می‌کند (پس باید از اپوس ۵ بهتر باشد)، در بارهای کاری معمول ۴۰٪ کمتر از اپوس ۵ هزینه دارد، و خروجی را بیش از ۳۰٪ سریع‌تر تولید می‌کند.

:

آنتروپیک همچنین قیمتی را که توسعه‌دهندگان برای استفاده از مدل از طریق API خود می‌پردازند کاهش داد. اپوس ۵.۵ برای هر میلیون توکن (تکه‌های متنی به طول تقریباً سه‌چهارم یک کلمه) ارسالی به مدل ۴ دلار و برای هر میلیون توکن نوشته‌شده ۲۰ دلار هزینه دارد که از ۵ و ۲۵ دلار برای اپوس ۵ کاهش یافته است. همین کاهش قیمت به‌تنهایی ۲۰٪ صرفه‌جویی را توضیح می‌دهد. باقی ۴۰٪ ادعاشده باید از استفاده مدل از توکن‌های کمتر بیاید.

:

می‌خواستم ببینم این موضوع برای کاربر معمولی کلود چه معنایی دارد، بنابراین این بار شبیه‌سازی‌های معمول گردش‌کار توسعه‌دهنده را نادیده گرفتم. اخیراً مدل‌هایی که آزمایش می‌کنم از عهده وظایف روزمره به‌خوبی برمی‌آیند. وظایف استدلالی جایی است که دیده‌ام به مشکل می‌خورند، پس اپوس ۵ را فقط در وظایف استدلالی در برابر اپوس ۵.۵ آزمایش کردم.

:

اگر می‌خواهید این آزمون‌ها را روی سیستم خودتان تکرار کنید، پرامپت‌ها را در انتهای این مطلب می‌یابید.

آزمون‌ها

هر دو مدل را با پرامپت‌های یکسان از طریق API آنتروپیک فراخوانی کردم. هر دو با تفکر تطبیقی در سطح تلاش پیش‌فرض اجرا شدند، چون اپوس ۵.۵ اجازه نمی‌دهد تفکر را خاموش کنید. هر مسئله یک بار برای هر مدل اجرا شد. قصد داشتم هر مسئله‌ای را که مدل‌ها نتایج متفاوتی در آن می‌دادند دوباره اجرا کنم، اما هرگز چنین نشد.

آزمون‌هایی که اجرا کردم:

  • جدول منطقی (سختی متوسط) – هفت مهندس هر کدام یک روز کشیک، یک زبان، یک سرویس و یک شهر دارند و ۲۲ سرنخ یک پاسخ را مشخص می‌کند. شش سرنخ شرطی یا از نوع «دقیقاً یکی از این‌ها درست است» هستند و حذف هر سرنخ واحد، معما را می‌شکند.
  • ترتیب‌های محدود (سختی دشوار) – ۱۰ کار استقرار را طوری بازچینی کنید که هیچ کاری در جای اصلی خود نماند و هیچ دو کار با شماره متوالی کنار هم قرار نگیرند. مدل باید تعداد را برای ۶، ۸ و ۱۰ کار ارائه می‌داد.
  • بازی سنگی با حافظه (سختی دشوارتر) – بازیکنان ۲، ۵، ۷ یا ۱۱ سنگ برمی‌دارند، اما نمی‌توانند حرکت آخر حریف یا حرکت آخر خود را تکرار کنند. مدل باید تعیین می‌کرد چه کسی از ۲۰۰ سنگ برنده می‌شود، تعداد اندازه‌های شروع باخت تا ۵۰۰ را می‌شمرد و کوچک‌ترین اندازه باخت بالای ۳۴۰ را نام می‌برد.

:

توکن‌های ورودی، توکن‌های خروجی، هزینه با قیمت فهرست و زمان هر فراخوانی را ثبت کردم. توکن‌های تفکر به‌عنوان خروجی محاسبه می‌شوند، پس آن‌ها را هم لحاظ کردم.

جدول منطقی

هر دو مدل هر ۲۸ خانه را درست پر کردند. اپوس ۵.۵ ۶۵ ثانیه و ۷٬۵۷۳ توکن خروجی صرف کرد، با هزینه ۰٫۱۶ دلار. اپوس ۵ ۱۰۸ ثانیه و ۱۰٬۶۲۱ توکن خروجی صرف کرد، با هزینه ۰٫۲۷ دلار.

در این آزمون، اپوس ۵.۵ ۴۳٪ ارزان‌تر بود و همان پاسخ درست را ارائه داد. اپوس ۵.۵ کمی مفصل‌تر بود و اشاره کرد که یکتایی راه‌حل را کاملاً اثبات نکرده است.

ترتیب‌های محدود

هیچ‌کدام از مدل‌ها پاسخی تولید نکردند و همین آن را در عمل دشوارترین مسئله ساخت. تعدادهای درست ۲۷، ۱٬۶۹۵ و ۱۵۹٬۰۱۹ هستند. رسیدن به پاسخ سوم تنها با استدلال بسیار دشوار است. یک برنامه رایانه‌ای که همه ترتیب‌های ممکن را بررسی کند می‌تواند آن را بیابد، اما هیچ‌کدام از مدل‌ها در این آزمون نمی‌توانستند کد اجرا کنند.

با محدودیت خروجی ۴۸٬۰۰۰ توکن، هر دو مدل تمام بودجه را صرف تفکر کردند و هرگز پاسخ ندادند. اپوس ۵.۵ ۴۸۹ ثانیه و ۰٫۹۶ دلار صرف کرد. اپوس ۵ ۵۵۳ ثانیه و ۱٫۲۰ دلار صرف کرد.

محدودیت را به ۱۲۸٬۰۰۰ توکن افزایش دادم و دوباره اجرا کردم. اپوس ۵ از تمام توکن‌ها استفاده کرد، بیش از ۲۵ دقیقه طول کشید و بدون پاسخ متوقف شد. این ۳٫۲۰ دلار هزینه داشت. اپوس ۵.۵ ۱۹ دقیقه اجرا شد و ۱۱۲٬۷۳۳ توکن استفاده کرد، اما API پاسخ را با دلیل توقف «رد» و بدون متن پایان داد. پرامپت از مدل می‌خواهد ترتیب‌های کار را بشمارد و هیچ محتوای حساسی ندارد. این یعنی رد کردن به احتمال زیاد اشتباهی از سوی فیلتر ایمنی آنتروپیک بوده که یک درخواست بی‌ضرر را علامت‌گذاری کرده است.

اپوس ۵.۵ ارزان‌تر بود، اما اگر نتیجه‌ای نگیرید این چه اهمیتی دارد؟

بازی سنگی

و دوباره به همان پاسخ‌های یکسان برگشتیم. هر دو مدل به هر سه بخش درست پاسخ دادند. بازیکن اول از ۲۰۰ سنگ می‌بازد؛ اندازه‌های شروع از ۱۲۰ تا ۵۰۰ باخت هستند و کوچک‌ترین باخت بالای ۳۴۰ عدد ۳۴۴ است.

تفاوت در این آزمون به میزان تفکری که هر کدام برای رسیدن به پاسخ نیاز داشتند برمی‌گشت. اپوس ۵.۵ در ۲۱۵ ثانیه با ۲۸٬۷۴۰ توکن خروجی تمام شد و ۰٫۵۸ دلار هزینه داشت. اپوس ۵ ۶۲۴ ثانیه طول کشید و ۷۴٬۹۸۱ توکن خروجی تولید کرد و ۱٫۸۸ دلار هزینه داشت. اپوس ۵.۵ برای همان پاسخ ۶۲٪ توکن کمتر و ۶۹٪ هزینه کمتر داشت.

نتایج

آزمون اپوس ۵.۵ اپوس ۵
جدول منطقی ۲۸/۲۸، ۱:۰۵، ۹۰۸ ورودی / ۷٬۵۷۳ خروجی، ۰٫۱۶ دلار ۲۸/۲۸، ۱:۴۸، ۹۰۶ ورودی / ۱۰٬۶۲۱ خروجی، ۰٫۲۷ دلار
مسئله ترتیب‌دهی (محدودیت ۴۸ هزار) بدون پاسخ، ۸:۰۹، ۲۳۵ ورودی / ۴۸٬۰۰۰ خروجی، ۰٫۹۶ دلار بدون پاسخ، ۹:۱۳، ۲۳۳ ورودی / ۴۸٬۰۰۰ خروجی، ۱٫۲۰ دلار
مسئله ترتیب‌دهی (محدودیت ۱۲۸ هزار) بدون پاسخ (رد)، ۱۸:۵۶، ۲۳۵ ورودی / ۱۱۲٬۷۳۳ خروجی، ۲٫۲۶ دلار بدون پاسخ، ۲۵:۲۴، ۲۳۳ ورودی / ۱۲۸٬۰۰۰ خروجی، ۳٫۲۰ دلار
بازی سنگی ۳/۳، ۳:۳۵، ۳۲۳ ورودی / ۲۸٬۷۴۰ خروجی، ۰٫۵۸ دلار ۳/۳، ۱۰:۲۴، ۳۲۱ ورودی / ۷۴٬۹۸۱ خروجی، ۱٫۸۸ دلار
مجموع توکن‌ها ۱٬۷۰۱ ورودی / ۱۹۷٬۰۴۶ خروجی ۱٬۶۹۳ ورودی / ۲۶۱٬۶۰۲ خروجی
مجموع زمان ۳۱ دقیقه و ۴۵ ثانیه ۴۶ دقیقه و ۴۹ ثانیه
هزینه ۳٫۹۵ دلار (۴ دلار ورودی / ۲۰ دلار خروجی به ازای هر میلیون توکن) ۶٫۵۵ دلار (۵ دلار ورودی / ۲۵ دلار خروجی به ازای هر میلیون توکن)

در مجموع تمام فراخوانی‌ها، اپوس ۵.۵ ثانیه‌ای ۱۰۳٫۴ توکن نوشت و اپوس ۵ ثانیه‌ای ۹۳٫۱ توکن، پس اپوس ۵.۵ حدود ۱۱٪ سریع‌تر بود. بزرگ‌ترین برتری سرعت آن در یک مسئله واحد ۱۹٪ بود که همچنان کمتر از ادعای ۳۰ درصدی آنتروپیک است. بزرگ‌ترین صرفه‌جویی هزینه‌اش در بازی سنگی رخ داد که ۰٫۵۸ دلار در برابر ۱٫۸۸ دلار اپوس ۵، یعنی ۶۹٪ کمتر، هزینه داشت. مجموع هزینه آزمون ۱۰٫۵۰ دلار بود.

نظر من چیست

بنچمارک‌های آنتروپیک نشان می‌دهند اپوس ۵.۵ در کدنویسی، کار دانشی و استدلال از اپوس ۵ جلوتر است. من آن بنچمارک‌ها را دوباره اجرا نکردم. به هر دو مدل همان سه مسئله استدلالی را دادم و عملکردشان برابر بود. هر دو جدول منطقی و بازی سنگی را حل کردند و هر دو در مسئله ترتیب‌دهی شکست خوردند.

صرفه‌جویی واقعی است. اپوس ۵.۵ در هر مسئله کمتر هزینه داشت و زودتر تمام شد، از جمله ۴۳٪ کمتر در جدول منطقی و ۶۹٪ کمتر در بازی سنگی. بیشتر این صرفه‌جویی از استفاده از توکن‌های خروجی کمتر می‌آمد. کاهش قیمت ۲۰٪ را توضیح می‌دهد. سرعت نوشتنش ۱۱٪ بیشتر بود که کمتر از ۳۰٪ ادعایی آنتروپیک است.

اگر امروز از اپوس ۵ استفاده می‌کنید، به اپوس ۵.۵ مهاجرت کنید. در استدلال دشوار با هزینه کمتر و انتظار کمتر همان نتایج را می‌گیرید. اما محدودیت سخت خروجی تعیین کنید و هزینه‌تان را در مسائل دشوار زیر نظر بگیرید. هر دو مدل می‌توانند نزدیک به ۲۰ دقیقه یا بیشتر فکر کنند و هیچ چیزی برنگردانند که اگر برای هر توکن پول بدهید مشکلی است. برای مسائل شمارشی مانند آزمون ترتیب‌دهی، به مدل یک ابزار اجرای کد بدهید، نه اینکه امیدوار باشید با استدلال از پس آن بربیاید.

پرامپت‌ها

جدول منطقی

هفت مهندس (آنا، بن، سای، دی، ایلای، فی، گاس) در یک چرخه کشیک سهیم هستند. هر کدام دقیقاً یک روز از یک هفته، از دوشنبه تا یکشنبه (دوشنبه زودترین روز و یکشنبه دیرترین)، کشیک هستند و هیچ دو نفری یک روز مشترک ندارند. هر کدام به زبان متفاوتی می‌نویسند (Go، Rust، Python، Java، Kotlin، TypeScript، C++)، مالک سرویس متفاوتی هستند (auth، billing، search، queue، cache، gateway، metrics) و در شهر متفاوتی مستقر هستند (برلین، توکیو، دنور، لاگوس، سیدنی، تورنتو، بمبئی).

سرنخ‌ها:

توسعه‌دهنده جاوا گاس است.

توسعه‌دهنده تایپ‌اسکریپت دقیقاً دو روز بعد از مالک صف کشیک است.

دقیقاً یکی از این‌ها درست است: مهندس مستقر در برلین مالک صورت‌حساب است، یا توسعه‌دهنده C++ دوشنبه کشیک است.

دقیقاً یکی از این‌ها درست است: مهندس مستقر در توکیو مالک کش است، یا مهندس مستقر در توکیو به زبان Rust می‌نویسد.

اگر فی یکشنبه کشیک باشد، آنگاه مهندس مستقر در دنور به زبان Kotlin نمی‌نویسد.

دقیقاً یکی از این‌ها درست است: توسعه‌دهنده Kotlin مالک احراز هویت است، یا توسعه‌دهنده C++ سای است.

مهندس مستقر در توکیو در هفته زودتر از توسعه‌دهنده C++ کشیک است.

مهندس مستقر در دنور به زبان Python نمی‌نویسد.

دقیقاً یکی از این‌ها درست است: توسعه‌دهنده Go بن است، یا مالک دروازه در برلین مستقر است.

آنا در بمبئی مستقر است.

توسعه‌دهنده تایپ‌اسکریپت در هفته زودتر از فی کشیک است.

مهندس مستقر در سیدنی در هفته زودتر از مالک صورت‌حساب کشیک است.

مالک دروازه در هفته زودتر از توسعه‌دهنده Kotlin کشیک است.

مهندس کشیک یکشنبه در برلین مستقر نیست.

فی و مهندس مستقر در لاگوس در روزهای متوالی کشیک هستند.

ایلای دقیقاً سه روز بعد از مالک احراز هویت کشیک است.

مهندس مستقر در لاگوس به زبان Java می‌نویسد.

دقیقاً یکی از این‌ها درست است: مالک جستجو ایلای است، یا مالک کش دی است.

مالک دروازه و توسعه‌دهنده Go در روزهای متوالی کشیک هستند.

مهندس مستقر در لاگوس دقیقاً چهار روز بعد از مالک احراز هویت کشیک است.

مهندس مستقر در لاگوس مالک معیارها است.

مهندس مستقر در بمبئی در هفته زودتر از توسعه‌دهنده Python کشیک است.

تخصیص کامل را تعیین کنید. در پایان پاسخ خود، دقیقاً هفت خط، یکی برای هر مهندس به ترتیب آنا، بن، سای، دی، ایلای، فی، گاس، با این قالب ارائه دهید:

ANSWER: Name | Day | Language | Service | City

مسئله ترتیب‌دهی

یک سیستم ساخت n کار استقرار شماره‌گذاری‌شده از ۱ تا n دارد. در ابتدا، کار k در جایگاه k اجرا می‌شود. شما همه n کار را در جایگاه‌های ۱ تا n بازچینی می‌کنید (هر جایگاه یک کار می‌گیرد) با رعایت دو قاعده:

هیچ کاری در جایگاه اصلی خود اجرا نمی‌شود (کار k در جایگاه k نیست).

کارهای با شماره متوالی هرگز در جایگاه‌های مجاور اجرا نمی‌شوند (برای مثال، کارهای ۴ و ۵ نمی‌توانند به هر ترتیبی در جایگاه‌های i و i+1 باشند).

چند ترتیب معتبر برای (الف) n = 6، (ب) n = 8، (ج) n = 10 وجود دارد؟

در پایان پاسخ خود، دقیقاً سه خط با این قالب ارائه دهید:

ANSWER a: <number>

ANSWER b: <number>

ANSWER c: <number>

بازی سنگی

دو بازیکن با توده‌ای از سنگ‌ها بازی می‌کنند. آن‌ها به‌نوبت بازی می‌کنند. در هر نوبت، بازیکن دقیقاً ۲، ۵، ۷ یا ۱۱ سنگ برمی‌دارد، با رعایت دو قاعده:

نمی‌توانید همان تعدادی را بردارید که حریف در آخرین نوبت خود برداشت.

نمی‌توانید همان تعدادی را بردارید که خودتان در آخرین نوبت خود برداشتید.

(در اولین نوبت بازی، هیچ‌کدام از قواعد اعمال نمی‌شود. در اولین نوبت بازیکن دوم، فقط قاعده اول اعمال می‌شود.) نمی‌توانید بیشتر از سنگ‌های موجود در توده بردارید. بازیکنی که در نوبت خود حرکت قانونی ندارد می‌بازد. هر دو بازیکن بی‌نقص بازی می‌کنند.

(الف) با شروع از ۲۰۰ سنگ، آیا بازیکن اول برنده می‌شود؟

(ب) بازیکن اول برای چند اندازه شروع از ۱ تا ۵۰۰ (شامل) می‌بازد؟

(ج) کوچک‌ترین اندازه شروع بزرگ‌تر از ۳۴۰ که بازیکن اول در آن می‌بازد چیست؟

در پایان پاسخ خود، دقیقاً سه خط با این قالب ارائه دهید:

ANSWER a: <yes or no>

ANSWER b: <number>

ANSWER c: <number>

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: thenewstack.io