تکنولوژی
آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی همسطح Fable 5.1 اما ارزانتر
اولین عضو از خانواده مدلهای پیشرو جدید آنتروپیک از راه رسید.
منتشر شده
21 دقیقه پیشدر
آنتروپیک از Claude Opus 5.5، نخستین مدل از خانواده جدید Claude 5.5، رونمایی کرد. این مدل در بیشتر کارها عملکردی همسطح Claude Fable 5.1 دارد و هزینه اجرای آن ۴۰ درصد کمتر از Opus 5 است.
کلاد Opus 5.5 نسبت به Opus 5 پیشرفت قابلتوجهی داشته و آنتروپیک آن را مدل پیشرو جدید خود معرفی میکند. آزمایشکنندگان اولیه در پیچیدهترین کارهای خود جهشهای محسوسی در عملکرد آن مشاهده کردهاند. آنتروپیک میگوید یکی از آزمایشکنندگان با استفاده از این مدل مهاجرت ۶۸۰ هزار خط کد را در کمتر از یک روز انجام داد؛ کاری که انجام آن برای یک تیم مهندسی هفتهها زمان میبرد.
Opus 5.5 همچنین در پیدا و برطرف کردن ناکارآمدیهای نرمافزاری عملکرد خوبی دارد. وقتی از مدل خواسته شد زمان بارگذاری تمام صفحات یک اپلیکیشن وب را کاهش دهد، در ۳۹ مورد از ۴۰ مورد موفق شد. در مقابل، Opus 5 بهبودهای کوچکتری ایجاد کرد که رفتار اپلیکیشن را نیز تغییر میداد. در آزمایش دیگری، چند مدل Claude مأمور شدند تنها با دریافت یک پرامپت، بازی بسازند و Opus 5.5 از نظر کیفیت گرافیکی و پرداخت نهایی، امتیاز بیشتری از تمام مدلهای دیگر به دست آورد.
از آنجا که Opus 5.5 در زیستشناسی و امنیت سایبری عملکردی مشابه Claude Mythos 5.1 دارد، آنتروپیک آن را با تدابیر ایمنی مشابه Claude Fable 5.1 عرضه میکند. سازمانهای تأییدشده میتوانند برای استفاده از Opus 5.5 در پژوهشهای زیستشناسی به برنامه Life Sciences Verification Program درخواست دهند. آنتروپیک همچنین طی هفتههای آینده دسترسی به Cyber Verification Program را گسترش میدهد تا متخصصان تأییدشده امنیت سایبری بتوانند از Opus 5.5 در کارهای خود استفاده کنند.
هزینه و سرعت Claude Opus 5.5
Opus 5.5 برای ارائه خدمات به توان پردازشی کمتری نسبت به Opus 5 نیاز دارد و قیمتگذاری آن نیز این موضوع را منعکس میکند. آزمایشهای آنتروپیک نشان میدهند که این مدل در تنظیمات پیشفرض و کارهای معمول، ۴۰ درصد ارزانتر از Opus 5 است.
قیمت هر یک میلیون توکن ورودی و خروجی بهترتیب ۴ و ۲۰ دلار است که ۲۰ درصد کمتر از Opus 5 محسوب میشود. خواندن توکنهای کششده که بخش عمده هزینه کارهای عاملی و کدنویسی را تشکیل میدهند، به ازای هر یک میلیون توکن ۰.۲۰ دلار هزینه دارد؛ یعنی ۶۰ درصد کمتر از Opus 5. اوپوس 5.5 همچنین خروجی را بیش از ۳۰ درصد سریعتر از Opus 5 تولید میکند.

علاوهبر کاهش قیمت، آنتروپیک محدودیت استفاده پنجساعته را در طرحهای پرو، مکس و تیم افزایش داده است. کاربران اشتراکی همچنین امکان دریافت مجدد سهمیه محدودیت نرخ را دارند و میتوانند این امکان را ذخیره کرده و هر زمان که خواستند استفاده کنند.
Opus 5.5 در مقایسه با مدلهای قبلی ارتباط طبیعیتری دارد. آزمایشکنندگان اولیه نوشتههای آن را واضحتر و دنبال کردن آنها را آسانتر دانستهاند؛ موضوعی که بخشی از بازخوردهای رایج درباره Opus 5 را برطرف میکند. این مدل مهمترین اطلاعات را در ابتدای پاسخ قرار میدهد و سبک نگارشش باعث میشود در جلسات کاری طولانی، همراه کاری بهتری باشد.
Claude Sonnet 5.5 و Claude Haiku 5.5 نیز طی هفتههای آینده عرضه خواهند شد و بسیاری از بهبودهای عملکرد، بهرهوری و ایمنی Opus 5.5 را ارائه خواهند کرد.
عملکرد و بهرهوری هزینه کلاد اوپوس ۵.۵
در بنچمارکهای آنتروپیک، Claude Opus 5.5 در کدنویسی عاملمحور، استفاده از رایانه و کارهای مبتنی بر دانش پیشتاز است. بااینحال، آنتروپیک میگوید در این سطح از قابلیت، اختلاف امتیازهای بنچمارکها دیگر راهنمای کاملاً قابلاعتمادی برای تفاوت عملکرد در دنیای واقعی نیست. در استفاده داخلی این شرکت، فاصله Opus 5.5 و Claude Fable 5.1 کمتر از چیزی بوده که امتیازهای بنچمارک نشان میدهند.

مزیت اوپوس 5.5 در بهرهوری واضحتر است. این مدل به ازای هر توکن هزینه کمتری نسبت به Opus 5 دارد و برای هر کار نیز توکنهای کمتری مصرف میکند؛ در مجموع، این موارد باعث کاهش ۴۰ درصدی هزینه میشوند.
حالت سریع Opus 5.5 نیز در Claude Code و Claude Platform با سرعت حداکثر ۲.۵ برابر در دسترس است. این حالت به ازای هر یک میلیون توکن ورودی ۸ دلار و به ازای هر یک میلیون توکن خروجی ۴۰ دلار هزینه دارد.
تواناییهای مدل جدید آنتروپیک در کدنویسی
Opus 5.5 بهویژه برای کارهای طولانی و گسترده مانند مهاجرت و ممیزی کل یک پایگاه کد عملکرد خوبی دارد. یکی از آزمایشکنندگان اولیه از این مدل برای ممیزی و اصلاح یک پایگاه کد ۲۰۰ هزار خطی در کمتر از سه ساعت استفاده کرد؛ درحالیکه Opus 5 برای همین کار بیش از ۲۰ ساعت زمان برد و ۲.۵ برابر توکن بیشتری مصرف کرد.



در یک آزمایش داخلی، آنتروپیک از Opus 5.5 و Fable 5.1 خواست HAProxy، نرمافزار پرکاربردی که بار ترافیک وب را میان سرورها توزیع میکند، از زبان C به Rust منتقل کنند. هر دو نسخه تقریباً تمام آزمونهای رگرسیون خود HAProxy را با موفقیت پشت سر گذاشتند، اما Opus 5.5 این کار را در ۹.۵ ساعت در مقابل ۱۲ ساعت برای Fable 5.1 انجام داد و هزینه آن ۵۱ درصد کمتر بود.
Opus 5.5 در کدنویسی ایجنتی، نتایجی در سطح پیشرفته ارائه میدهد و هزینه آن نیز کسری از هزینه مدلهای رقیب است. در سطح تلاش پیشفرض FrontierCode، این مدل GPT-6 Astra را با حدود ۲۰ درصد هزینه هر کار شکست میدهد. در Terminal Bench 4.0 نیز عملکردی مشابه Astra با حدود ۴۰ درصد هزینه آن دارد. در CursorBench هم با هزینهای حدود یکسوم GPT-5.6 Sol، امتیاز Opus 5.5 حدود ۱۱ امتیاز بیشتر است.
کارهای دانشمحور
Opus 5.5 بهعنوان یک پژوهشگر قابلاعتماد و توانمند معرفی شده است. در یک آزمایش داخلی، آنتروپیک از Opus 5.5 ،Fable 5.1 و Opus 5 خواست گزارشی درباره عملکرد فصلی یک شرکت تهیه کنند و فقط از اطلاعات موجود در نسخهای از وب استفاده کنند که پیدا کردن گزارش درآمدی در آن دشوار بود.
یک ارزیاب خودکار تمام ارقام و نقلقولها را با منابع مقایسه کرد. در تنظیمات مختلف میزان تلاش، ۱۶ مورد از ۱۸ گزارش Opus 5.5 از معیار کیفی آنتروپیک عبور کردند؛ در این ارزیابی، وجود هر رقم یا نقلقول ساختگی باعث رد شدن گزارش میشد. Fable 5.1 و Opus 5 در هیچیک از تلاشهای خود نتوانستند از این معیار عبور کنند.
Opus 5.5 در تحلیل مالی و کارهای تجاری نیز عملکرد قدرتمندی دارد. Walleye Capital، یک شرکت سرمایهگذاری و از آزمایشکنندگان اولیه این مدل، گزارش داده که Opus 5.5 در پایینترین سطح تنظیمات، بخش عمده آزمونهای ارزیابی این شرکت را حل کرده است. در تنظیمات بالاتر، عملکرد آن ارتقا یافت و حتی متوجه خطایی در دستورالعملهای ارزیابی شرکت شد و آن را اصلاح کرد. هیچ مدل دیگری پیش از آن این خطا را شناسایی نکرده بود.



در ارزیابیهای مربوط به کارهای مبتنی بر دانش، Opus 5.5 ضمن مصرف توکن کمتر، عملکرد بهتری نسبت به سایر مدلها دارد. در GDPval-AA v2.1، آزمونی برای سنجش کارهای واقعی در ۴۴ شغل، Opus 5.5 امتیاز ۱۸۴۶ Elo را به دست آورده که بالاتر از Fable 5.1 و Opus 5 است. در سطح تلاش پیشفرض، یعنی متوسط، Opus 5.5 با حدود یکپنجم هزینه هر کار، GPT-6 Astra را در بالاترین سطح تلاش شکست میدهد. این مدل همچنین در بنچمارکهای مربوط به گردش کارهای تجاری و جمعآوری داده در مقیاس بزرگ، عملکرد بهتری نسبت به سایر مدلها داشته است.
اقدامات ایمنی
نسل فعلی مدلها به مجموعهای تثبیتشده از اقدامات ایمنی متکی است که شامل آزمونهای گسترده همسویی، ارزیابی پیش از عرضه توسط سازمانهای خارجی مانند METR و Frontier Design و تدابیر ایمنی متناسب با قابلیتهای هر مدل در حوزههای پرخطر مانند امنیت سایبری و زیستشناسی میشود.
آنتروپیک این اقدامات را با عرضه هر مدل اصلاح میکند. این شرکت معتقد است اقدامات مذکور برای جدیترین خطراتی که مدلهای امروزی ایجاد میکنند مناسب هستند و تصویری گسترده، هرچند نه کامل، از طیف خطرات جدی ارائه میدهند.
آنتروپیک همچنین توانایی خود برای آموزش و ارزیابی مدلهای همسو را دنبال میکند و درباره مدلهای عمومی و داخلی خود در گزارشهای خطری که منتشر میشوند، گزارش میدهد. این سیاست چارچوبی داوطلبانه برای مدیریت خطرات فاجعهبار ناشی از سامانههای پیشرفته هوش مصنوعی است.
همسویی
در مجموعه ارزیابی اصلی آنتروپیک، یعنی یک ممیزی رفتاری خودکار که Claude را در نزدیک به ۲ هزار سناریو بررسی میکند، Opus 5.5 در تقریباً تمام معیارهای مربوط به رفتار ناهماهنگ، عملکرد بهتری از تمام مدلهای اخیر Claude داشته است. این مدل همچنین در بیشتر معیارهای صداقت، قدرتمندترین مدل آنتروپیک محسوب میشود.
Opus 5.5 در چندین رفتاری که در حوادث اخیر امنیت سایبری نقش داشتند نیز نسبت به مدلهای قبلی پیشرفت کرده است؛ ازجمله استدلال جانبدارانه یا هدفمحور، تلاش برای خروج از سندباکس و انجام اقدامات آسیبزا پس از آنکه مدل میفهمد در محیطی شبیهسازیشده قرار دارد.

در یک ارزیابی جدید برای سنجش تمایل مدل به عبور از مرزها، Opus 5.5 حدود ۸۵ درصد کمتر از Opus 5 یا Claude Mythos 5.1 تلاش کرد این مرزها را دور بزند. تمام تلاشهای Opus 5.5 نیز شدت پایینی داشتند و خود مدل آنها را گزارش کرد. برای تیمهایی که Claude را بدون نظارت مستقیم روی کدها و سیستمهای خود اجرا میکنند، این موضوع به اندازه قابلیت خام مدل اهمیت دارد.
بااینحال، آنتروپیک میگوید ایجاد ارزیابیهایی که بتوانند پیش از عرضه، تمام خطاهای مدل را با اطمینان شناسایی کنند همچنان مسئلهای حلنشده است. این شرکت نشانههایی دیده که حاکی است مدل Opus 5.5 اغلب احتمال میدهد در حال ارزیابی شدن است؛ موضوعی که سنجش نحوه رفتار مدل در طیف گسترده محیطهای واقعی را دشوار میکند.
آنتروپیک انتظار دارد با گسترش این محیطها و افزایش قابلیت مدلها، این چالش نیز بیشتر شود؛ مگر اینکه در حوزه تفسیرپذیری پیشرفت حاصل شود. این شرکت میگوید با وجود اطمینان از بهبود گسترده Opus 5.5 در حوزههایی که قابل اندازهگیری هستند، اقدامات همسویی خود را با تدابیر ایمنی بسیاری همراه کرده است.
امنیت سایبری
از آنجا که Opus 5.5 قابلیتهای بسیار قدرتمندی در امنیت سایبری دارد، آنتروپیک تدابیر ایمنی مشابه Fable 5.1 را برای این مدل اعمال میکند. کاربران میتوانند بهعنوان بخشی از چرخه معمول توسعه نرمافزار، با Opus 5.5 باگهای کد خود را شناسایی و برطرف کنند، اما بیشتر وظایف امنیت سایبری به Opus 4.8 هدایت خواهند شد.
آنتروپیک قصد دارد برنامه Cyber Verification Program را بهزودی برای متخصصان دفاع سایبری گسترش دهد تا Opus 5.5 را نیز شامل شود. برنامه جدید سه سطح برای دسترسی خواهد داشت که شامل دسترسی به مدلهای Claude Mythos نیز میشود. Claude Security هماکنون با دسترسی به Claude Mythos 5.1 در دسترس است.
زیستشناسی
Opus 5.5 در حوزه زیستشناسی قابلیت بالایی دارد و در بسیاری از زمینههای کاری، عملکرد آن از Opus 5 بهتر و همسطح یا بهتر از Claude Mythos 5.1 است. برای نمونه، Opus 5.5 در یک ارزیابی پیشبینی و طراحی مولکولی بلندمدت که با همکاری Dyno Therapeutics انجام شد، پیشرفتهایی به دست آورد. ارزیابان متخصص نیز نوآوری علمی آن را همسطح بهترین مدلی دانستند که آزمایش کرده بودند.
عرضه
کلاد Opus 5.5 اکنون روی تمام پلتفرمها، ازجمله Amazon Web Services ،Google Cloud و مایکروسافت آژور در دسترس است. توسعهدهندگان در Claude Platform نیز میتوانند با مدل claude-opus-5-5 کار خود را آغاز کنند.
شاید دوست داشته باشید
آنتروپیک از مدل Claude Opus 5.5 رونمایی کرد؛ عملکردی همسطح Fable 5.1 اما ارزانتر
ثبت بیش از ۶ هزار تماس با اورژانس ۱۱۵ قم در یک هفته
ظفرقندی: کمبودهای دارویی نصف شده است
پیام تبریک مدیرکل راهداری و حمل و نقل جادهای لرستان به مناسبت گرامیداشت هفته دفاع مقدس
نظام اداری کشور ازظرفیت و توان قابل توجهی برخوردار است
ببینید | ششمین نشست هماندیشی معاونان توسعه مدیریت و منابع دستگاههای اجرایی
اصلاح نظام اداری با تمرکز بر کاهش تردد، تمرکززدایی و پاسخگویی سریع به مردم
پیام مدیرعامل شرکت عمران شهرهای جدید به مناسبت آغاز هفته دفاع مقدس
«فصلنامه مجری» نخستین نشریه تخصصی سازمان مجری منتشر شد
خورسندیان: بانک مسکن همچنان تأمین مالی پروژههای نهضت ملی کرمان را در دستور کار دارد
تفاوت ارتودنسی ثابت و متحرک
قیمت طلا و سکه دوشنبه 30 شهریور/ افزایش همه قیمتها
عراقچی به نیویورک رفت
افزایش بیتکوین با قلاب نرخ بهره
ساخت ترکیب مغز انسان و موش در یک آزمایشگاه!
راهنمای خرید کفش های بارداری
ساماندهی معابر ۵ محله واقع در بافت فرسوده شادگان آغاز شد
دمای هوای استان زنجان کاهش می یابد
گزارش: نام دو شخصیت بازی Injustice 3 فاش شد

جدیدترین اخبار پربحث