با ما همراه باشید

تکنولوژی

آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

اولین عضو از خانواده مدل‌های پیشرو جدید آنتروپیک از راه رسید.

منتشر شده

در

آنتروپیک از Claude Opus 5.5، نخستین مدل از خانواده جدید Claude 5.5، رونمایی کرد. این مدل در بیشتر کارها عملکردی هم‌سطح Claude Fable 5.1 دارد و هزینه اجرای آن ۴۰ درصد کمتر از Opus 5 است.

کلاد Opus 5.5 نسبت به Opus 5 پیشرفت قابل‌توجهی داشته و آنتروپیک آن را مدل پیشرو جدید خود معرفی می‌کند. آزمایش‌کنندگان اولیه در پیچیده‌ترین کارهای خود جهش‌های محسوسی در عملکرد آن مشاهده کرده‌اند. آنتروپیک می‌گوید یکی از آزمایش‌کنندگان با استفاده از این مدل مهاجرت ۶۸۰ هزار خط کد را در کمتر از یک روز انجام داد؛ کاری که انجام آن برای یک تیم مهندسی هفته‌ها زمان می‌برد.

Opus 5.5 همچنین در پیدا و برطرف کردن ناکارآمدی‌های نرم‌افزاری عملکرد خوبی دارد. وقتی از مدل خواسته شد زمان بارگذاری تمام صفحات یک اپلیکیشن وب را کاهش دهد، در ۳۹ مورد از ۴۰ مورد موفق شد. در مقابل، Opus 5 بهبودهای کوچک‌تری ایجاد کرد که رفتار اپلیکیشن را نیز تغییر می‌داد. در آزمایش دیگری، چند مدل Claude مأمور شدند تنها با دریافت یک پرامپت، بازی بسازند و Opus 5.5 از نظر کیفیت گرافیکی و پرداخت نهایی، امتیاز بیشتری از تمام مدل‌های دیگر به دست آورد.

از آنجا که Opus 5.5 در زیست‌شناسی و امنیت سایبری عملکردی مشابه Claude Mythos 5.1 دارد، آنتروپیک آن را با تدابیر ایمنی مشابه Claude Fable 5.1 عرضه می‌کند. سازمان‌های تأییدشده می‌توانند برای استفاده از Opus 5.5 در پژوهش‌های زیست‌شناسی به برنامه Life Sciences Verification Program درخواست دهند. آنتروپیک همچنین طی هفته‌های آینده دسترسی به Cyber Verification Program را گسترش می‌دهد تا متخصصان تأییدشده امنیت سایبری بتوانند از Opus 5.5 در کارهای خود استفاده کنند.

هزینه و سرعت Claude Opus 5.5

Opus 5.5 برای ارائه خدمات به توان پردازشی کمتری نسبت به Opus 5 نیاز دارد و قیمت‌گذاری آن نیز این موضوع را منعکس می‌کند. آزمایش‌های آنتروپیک نشان می‌دهند که این مدل در تنظیمات پیش‌فرض و کارهای معمول، ۴۰ درصد ارزان‌تر از Opus 5 است.

قیمت هر یک میلیون توکن ورودی و خروجی به‌ترتیب ۴ و ۲۰ دلار است که ۲۰ درصد کمتر از Opus 5 محسوب می‌شود. خواندن توکن‌های کش‌شده که بخش عمده هزینه کارهای عاملی و کدنویسی را تشکیل می‌دهند، به ازای هر یک میلیون توکن ۰.۲۰ دلار هزینه دارد؛ یعنی ۶۰ درصد کمتر از Opus 5. اوپوس 5.5 همچنین خروجی را بیش از ۳۰ درصد سریع‌تر از Opus 5 تولید می‌کند.

قیمت Claude Opus 5.5
آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

علاوه‌بر کاهش قیمت، آنتروپیک محدودیت استفاده پنج‌ساعته را در طرح‌های پرو، مکس و تیم افزایش داده است. کاربران اشتراکی همچنین امکان دریافت مجدد سهمیه محدودیت نرخ را دارند و می‌توانند این امکان را ذخیره کرده و هر زمان که خواستند استفاده کنند.

Opus 5.5 در مقایسه با مدل‌های قبلی ارتباط طبیعی‌تری دارد. آزمایش‌کنندگان اولیه نوشته‌های آن را واضح‌تر و دنبال کردن آنها را آسان‌تر دانسته‌اند؛ موضوعی که بخشی از بازخوردهای رایج درباره Opus 5 را برطرف می‌کند. این مدل مهم‌ترین اطلاعات را در ابتدای پاسخ قرار می‌دهد و سبک نگارشش باعث می‌شود در جلسات کاری طولانی، همراه کاری بهتری باشد.

Claude Sonnet 5.5 و Claude Haiku 5.5 نیز طی هفته‌های آینده عرضه خواهند شد و بسیاری از بهبودهای عملکرد، بهره‌وری و ایمنی Opus 5.5 را ارائه خواهند کرد.

عملکرد و بهره‌وری هزینه کلاد اوپوس ۵.۵

در بنچمارک‌های آنتروپیک، Claude Opus 5.5 در کدنویسی عامل‌محور، استفاده از رایانه و کارهای مبتنی بر دانش پیشتاز است. بااین‌حال، آنتروپیک می‌گوید در این سطح از قابلیت، اختلاف امتیازهای بنچمارک‌ها دیگر راهنمای کاملاً قابل‌اعتمادی برای تفاوت عملکرد در دنیای واقعی نیست. در استفاده داخلی این شرکت، فاصله Opus 5.5 و Claude Fable 5.1 کمتر از چیزی بوده که امتیازهای بنچمارک نشان می‌دهند.

بنچمارک Claude Opus 5.5
آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

مزیت اوپوس 5.5 در بهره‌وری واضح‌تر است. این مدل به ازای هر توکن هزینه کمتری نسبت به Opus 5 دارد و برای هر کار نیز توکن‌های کمتری مصرف می‌کند؛ در مجموع، این موارد باعث کاهش ۴۰ درصدی هزینه می‌شوند.

حالت سریع Opus 5.5 نیز در Claude Code و Claude Platform با سرعت حداکثر ۲.۵ برابر در دسترس است. این حالت به ازای هر یک میلیون توکن ورودی ۸ دلار و به ازای هر یک میلیون توکن خروجی ۴۰ دلار هزینه دارد.

توانایی‌های مدل جدید آنتروپیک در کدنویسی

Opus 5.5 به‌ویژه برای کارهای طولانی و گسترده مانند مهاجرت و ممیزی کل یک پایگاه کد عملکرد خوبی دارد. یکی از آزمایش‌کنندگان اولیه از این مدل برای ممیزی و اصلاح یک پایگاه کد ۲۰۰ هزار خطی در کمتر از سه ساعت استفاده کرد؛ درحالی‌که Opus 5 برای همین کار بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد.

در یک آزمایش داخلی، آنتروپیک از Opus 5.5 و Fable 5.1 خواست HAProxy، نرم‌افزار پرکاربردی که بار ترافیک وب را میان سرورها توزیع می‌کند، از زبان C به Rust منتقل کنند. هر دو نسخه تقریباً تمام آزمون‌های رگرسیون خود HAProxy را با موفقیت پشت سر گذاشتند، اما Opus 5.5 این کار را در ۹.۵ ساعت در مقابل ۱۲ ساعت برای Fable 5.1 انجام داد و هزینه آن ۵۱ درصد کمتر بود.

Opus 5.5 در کدنویسی ایجنتی، نتایجی در سطح پیشرفته ارائه می‌دهد و هزینه آن نیز کسری از هزینه مدل‌های رقیب است. در سطح تلاش پیش‌فرض FrontierCode، این مدل GPT-6 Astra را با حدود ۲۰ درصد هزینه هر کار شکست می‌دهد. در Terminal Bench 4.0 نیز عملکردی مشابه Astra با حدود ۴۰ درصد هزینه آن دارد. در CursorBench هم با هزینه‌ای حدود یک‌سوم GPT-5.6 Sol، امتیاز Opus 5.5 حدود ۱۱ امتیاز بیشتر است.

کارهای دانش‌محور

Opus 5.5 به‌عنوان یک پژوهشگر قابل‌اعتماد و توانمند معرفی شده است. در یک آزمایش داخلی، آنتروپیک از Opus 5.5 ،Fable 5.1 و Opus 5 خواست گزارشی درباره عملکرد فصلی یک شرکت تهیه کنند و فقط از اطلاعات موجود در نسخه‌ای از وب استفاده کنند که پیدا کردن گزارش درآمدی در آن دشوار بود.

یک ارزیاب خودکار تمام ارقام و نقل‌قول‌ها را با منابع مقایسه کرد. در تنظیمات مختلف میزان تلاش، ۱۶ مورد از ۱۸ گزارش Opus 5.5 از معیار کیفی آنتروپیک عبور کردند؛ در این ارزیابی، وجود هر رقم یا نقل‌قول ساختگی باعث رد شدن گزارش می‌شد. Fable 5.1 و Opus 5 در هیچ‌یک از تلاش‌های خود نتوانستند از این معیار عبور کنند.

Opus 5.5 در تحلیل مالی و کارهای تجاری نیز عملکرد قدرتمندی دارد. Walleye Capital، یک شرکت سرمایه‌گذاری و از آزمایش‌کنندگان اولیه این مدل، گزارش داده که Opus 5.5 در پایین‌ترین سطح تنظیمات، بخش عمده آزمون‌های ارزیابی این شرکت را حل کرده است. در تنظیمات بالاتر، عملکرد آن ارتقا یافت و حتی متوجه خطایی در دستورالعمل‌های ارزیابی شرکت شد و آن را اصلاح کرد. هیچ مدل دیگری پیش از آن این خطا را شناسایی نکرده بود.

در ارزیابی‌های مربوط به کارهای مبتنی بر دانش، Opus 5.5 ضمن مصرف توکن کمتر، عملکرد بهتری نسبت به سایر مدل‌ها دارد. در GDPval-AA v2.1، آزمونی برای سنجش کارهای واقعی در ۴۴ شغل، Opus 5.5 امتیاز ۱۸۴۶ Elo را به دست آورده که بالاتر از Fable 5.1 و Opus 5 است. در سطح تلاش پیش‌فرض، یعنی متوسط، Opus 5.5 با حدود یک‌پنجم هزینه هر کار، GPT-6 Astra را در بالاترین سطح تلاش شکست می‌دهد. این مدل همچنین در بنچمارک‌های مربوط به گردش کارهای تجاری و جمع‌آوری داده در مقیاس بزرگ، عملکرد بهتری نسبت به سایر مدل‌ها داشته است.

اقدامات ایمنی

نسل فعلی مدل‌ها به مجموعه‌ای تثبیت‌شده از اقدامات ایمنی متکی است که شامل آزمون‌های گسترده همسویی، ارزیابی پیش از عرضه توسط سازمان‌های خارجی مانند METR و Frontier Design و تدابیر ایمنی متناسب با قابلیت‌های هر مدل در حوزه‌های پرخطر مانند امنیت سایبری و زیست‌شناسی می‌شود.

آنتروپیک این اقدامات را با عرضه هر مدل اصلاح می‌کند. این شرکت معتقد است اقدامات مذکور برای جدی‌ترین خطراتی که مدل‌های امروزی ایجاد می‌کنند مناسب هستند و تصویری گسترده، هرچند نه کامل، از طیف خطرات جدی ارائه می‌دهند.

آنتروپیک همچنین توانایی خود برای آموزش و ارزیابی مدل‌های همسو را دنبال می‌کند و درباره مدل‌های عمومی و داخلی خود در گزارش‌های خطری که منتشر می‌شوند، گزارش می‌دهد. این سیاست چارچوبی داوطلبانه برای مدیریت خطرات فاجعه‌بار ناشی از سامانه‌های پیشرفته هوش مصنوعی است.

همسویی

در مجموعه ارزیابی اصلی آنتروپیک، یعنی یک ممیزی رفتاری خودکار که Claude را در نزدیک به ۲ هزار سناریو بررسی می‌کند، Opus 5.5 در تقریباً تمام معیارهای مربوط به رفتار ناهماهنگ، عملکرد بهتری از تمام مدل‌های اخیر Claude داشته است. این مدل همچنین در بیشتر معیارهای صداقت، قدرتمندترین مدل آنتروپیک محسوب می‌شود.

Opus 5.5 در چندین رفتاری که در حوادث اخیر امنیت سایبری نقش داشتند نیز نسبت به مدل‌های قبلی پیشرفت کرده است؛ ازجمله استدلال جانبدارانه یا هدف‌محور، تلاش برای خروج از سندباکس و انجام اقدامات آسیب‌زا پس از آنکه مدل می‌فهمد در محیطی شبیه‌سازی‌شده قرار دارد.

آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر
آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

در یک ارزیابی جدید برای سنجش تمایل مدل به عبور از مرزها، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 تلاش کرد این مرزها را دور بزند. تمام تلاش‌های Opus 5.5 نیز شدت پایینی داشتند و خود مدل آنها را گزارش کرد. برای تیم‌هایی که Claude را بدون نظارت مستقیم روی کدها و سیستم‌های خود اجرا می‌کنند، این موضوع به اندازه قابلیت خام مدل اهمیت دارد.

بااین‌حال، آنتروپیک می‌گوید ایجاد ارزیابی‌هایی که بتوانند پیش از عرضه، تمام خطاهای مدل را با اطمینان شناسایی کنند همچنان مسئله‌ای حل‌نشده است. این شرکت نشانه‌هایی دیده که حاکی است مدل Opus 5.5 اغلب احتمال می‌دهد در حال ارزیابی شدن است؛ موضوعی که سنجش نحوه رفتار مدل در طیف گسترده محیط‌های واقعی را دشوار می‌کند.

آنتروپیک انتظار دارد با گسترش این محیط‌ها و افزایش قابلیت مدل‌ها، این چالش نیز بیشتر شود؛ مگر اینکه در حوزه تفسیرپذیری پیشرفت حاصل شود. این شرکت می‌گوید با وجود اطمینان از بهبود گسترده Opus 5.5 در حوزه‌هایی که قابل اندازه‌گیری هستند، اقدامات همسویی خود را با تدابیر ایمنی بسیاری همراه کرده است.

امنیت سایبری

از آنجا که Opus 5.5 قابلیت‌های بسیار قدرتمندی در امنیت سایبری دارد، آنتروپیک تدابیر ایمنی مشابه Fable 5.1 را برای این مدل اعمال می‌کند. کاربران می‌توانند به‌عنوان بخشی از چرخه معمول توسعه نرم‌افزار، با Opus 5.5 باگ‌های کد خود را شناسایی و برطرف کنند، اما بیشتر وظایف امنیت سایبری به Opus 4.8 هدایت خواهند شد.

آنتروپیک قصد دارد برنامه Cyber Verification Program را به‌زودی برای متخصصان دفاع سایبری گسترش دهد تا Opus 5.5 را نیز شامل شود. برنامه جدید سه سطح برای دسترسی خواهد داشت که شامل دسترسی به مدل‌های Claude Mythos نیز می‌شود. Claude Security هم‌اکنون با دسترسی به Claude Mythos 5.1 در دسترس است.

زیست‌شناسی

Opus 5.5 در حوزه زیست‌شناسی قابلیت بالایی دارد و در بسیاری از زمینه‌های کاری، عملکرد آن از Opus 5 بهتر و هم‌سطح یا بهتر از Claude Mythos 5.1 است. برای نمونه، Opus 5.5 در یک ارزیابی پیش‌بینی و طراحی مولکولی بلندمدت که با همکاری Dyno Therapeutics انجام شد، پیشرفت‌هایی به دست آورد. ارزیابان متخصص نیز نوآوری علمی آن را هم‌سطح بهترین مدلی دانستند که آزمایش کرده بودند.

عرضه

کلاد Opus 5.5 اکنون روی تمام پلتفرم‌ها، ازجمله Amazon Web Services ،Google Cloud و مایکروسافت آژور در دسترس است. توسعه‌دهندگان در Claude Platform نیز می‌توانند با مدل claude-opus-5-5 کار خود را آغاز کنند.

ادامه مطلب
برای افزودن دیدگاه کلیک کنید

یک پاسخ بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

تکنولوژی21 دقیقه پیش

آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی هم‌سطح Fable 5.1 اما ارزان‌تر

ثبت بیش از ۶ هزار تماس با اورژانس ۱۱۵ قم در یک هفته
پزشکی و سلامت57 دقیقه پیش

ثبت بیش از ۶ هزار تماس با اورژانس ۱۱۵ قم در یک هفته

ظفرقندی: کمبودهای دارویی نصف شده است
پزشکی و سلامت57 دقیقه پیش

ظفرقندی: کمبودهای دارویی نصف شده است

پیام تبریک مدیرکل راهداری و حمل و نقل جاده‌ای لرستان به مناسبت گرامیداشت هفته دفاع مقدس
ساختمان و معماری1 ساعت پیش

پیام تبریک مدیرکل راهداری و حمل و نقل جاده‌ای لرستان به مناسبت گرامیداشت هفته دفاع مقدس

نظام اداری کشور ازظرفیت و توان قابل توجهی برخوردار است
ساختمان و معماری1 ساعت پیش

نظام اداری کشور ازظرفیت و توان قابل توجهی برخوردار است

ببینید | ششمین نشست هم‌اندیشی معاونان توسعه مدیریت و منابع دستگاه‌های اجرایی
ساختمان و معماری1 ساعت پیش

ببینید | ششمین نشست هم‌اندیشی معاونان توسعه مدیریت و منابع دستگاه‌های اجرایی

اصلاح نظام اداری با تمرکز بر کاهش تردد، تمرکززدایی و پاسخگویی سریع به مردم
ساختمان و معماری1 ساعت پیش

اصلاح نظام اداری با تمرکز بر کاهش تردد، تمرکززدایی و پاسخگویی سریع به مردم

پیام مدیرعامل شرکت عمران شهرهای جدید به مناسبت آغاز هفته دفاع مقدس
ساختمان و معماری1 ساعت پیش

پیام مدیرعامل شرکت عمران شهرهای جدید به مناسبت آغاز هفته دفاع مقدس

«فصلنامه مجری» نخستین نشریه تخصصی سازمان مجری منتشر شد
ساختمان و معماری1 ساعت پیش

«فصلنامه مجری» نخستین نشریه تخصصی سازمان مجری منتشر شد

خورسندیان: بانک مسکن همچنان تأمین مالی پروژه‌های نهضت ملی کرمان را در دستور کار دارد
ساختمان و معماری1 ساعت پیش

خورسندیان: بانک مسکن همچنان تأمین مالی پروژه‌های نهضت ملی کرمان را در دستور کار دارد

جدیدترین اخبار پربحث

خبر مهم اخیر

«مجله فان فارسی» از سال ۱۳۹۰ مجله‌ای در حوزه سرگرمی، سبک زندگی، سفر و فرهنگ روزمره است که با انتشار محتوای جذاب و الهام‌بخش، تجربه‌های زندگی شهری، تفریح، هنر و لحظه‌های خوش را برای مخاطبان روایت می‌کند. کپی بخش یا کل هر کدام از مطالب "فان فارسی" تنها با کسب مجوز مکتوب امکان پذیر است.