مدل هوشمصنوعی Claude Sonnet 5.5 آنتروپیک با افزایش سرعت و کاهش هزینهها برای کارهای روزمره و بهبود بیسابقه در کدنویسی رونمایی شد.
شرکت آنتروپیک (Anthropic)، یکی از پیشروان توسعه مدلهای زبانی بزرگ، اخیراً دومین عضو از خانوادهی قدرتمند Claude 5.5 خود را معرفی کرده است. این مدل جدید با نام Sonnet 5.5، بهطور خاص برای وظایف روزمره با دامنه مشخص و کارایی بالا طراحی شده است. در حالی که مدل Opus 5.5 برای کارهای پیچیده و نیازمند قضاوت دقیق کاربرد دارد، Sonnet 5.5 تعادلی عالی بین قدرت و کارایی ارائه میدهد. مدل Haiku 5.5 نیز بهزودی برای کاربردهای حجیم و کمهزینه به این خانواده اضافه خواهد شد.
قابلیتهای بهبودیافته Claude Sonnet 5.5
Claude Sonnet 5.5 پیشرفتهای چشمگیری نسبت به مدل Sonnet 5 در زمینههای عملکرد، کدنویسی، کار دانشبنیان، وظایف طولانیمدت، درک تصاویر، همکاری، سرعت و کارایی از خود نشان داده است. آنتروپیک نتایج زیر را گزارش کرده است:
- Terminal-Bench 4.0: امتیاز ۷۰٫۶٪ برای Sonnet 5.5 در مقایسه با ۱۰٫۳٪ برای Sonnet 5.
- GDPval-AA: Sonnet 5.5 تنها دو امتیاز کمتر از Opus 5.5 کسب کرده است.
- وظایف طولانیمدت: Sonnet 5.5 در کارهای دانشبنیان با افق زمانی طولانی، بهتر از Sonnet 5 و GPT-6 Sol عمل میکند.
- درک تصاویر: این اولین مدل Sonnet است که تنها با استفاده از اسکرینشاتها توانسته بازی پوکمون رد (Pokémon Red) را شکست دهد.
Sonnet 5.5 میتواند در سطوح تلاش مختلفی عمل کند که تعادل بین هزینه، سرعت و کیفیت خروجی را تغییر میدهد. آنتروپیک اعلام کرده است در چندین ارزیابی، Sonnet 5.5 با حداکثر تلاش (Max effort) عملکردی مشابه Opus 5.5 ارائه داده، در حالی که با تلاش پایین یا متوسط (Low or Medium effort)، میتواند بهترین امتیاز Sonnet 5 را در برخی بنچمارکها با حدود یک دهم هزینه هر وظیفه شکست دهد.
کدنویسی پیشرفته و بهبود بهرهوری
آنتروپیک همچنین نتایج چشمگیری در زمینهی کدنویسی برای Sonnet 5.5 گزارش کرده است:
- FrontierCode: در سطح تلاش بالا (High effort)، این مدل ۱۰ امتیاز بیشتر از Sonnet 5 در همین تنظیمات کسب کرده و هزینه هر وظیفه را به حدود یک پانزدهم کاهش داده است.
- CursorBench: بهترین امتیاز آن در وظایف برگرفته از جلسات کدنویسی واقعی Cursor، تنها حدود دو امتیاز با Opus 5.5 فاصله دارد.
آزمایشکنندگان اولیه گزارش دادند که Sonnet 5.5 میتواند به سرعت یک پایگاه کد (codebase) را درک کند. در آزمایشهای مستقیم، این مدل همچنین فراخوانی ابزارها را بیشتر از Sonnet 5 دستهبندی میکرد که منجر به گامهای کمتر و هزینههای پایینتر میشد.
کار دانشبنیان و تواناییهای جدید
Sonnet 5.5 در چندین حوزهی کار دانشبنیان نیز بهبود یافته است. آنتروپیک گزارش داد که این مدل در GDPval-AA، که وظایف دنیای واقعی را در ۴۴ شغل و ۹ صنعت اصلی پوشش میدهد، تقریباً همسطح Opus 5.5 عمل کرده و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 قرار گرفته است. این مدل همچنین در استفاده از کامپیوتر و تشخیص نمودارها به Opus 5.5 نزدیک است و در کارهای دانشبنیان طولانیمدت، عملکردی بهتر از Sonnet 5 و GPT-6 Sol از خود نشان میدهد.
آزمایشکنندگان اولیه نیز تغییراتی را در مکالمات و وظایف مرتبط با طراحی گزارش کردند، از جمله پیروی از قالبهای اسلاید هنگام ساخت ارائهها. در یک آزمایش داخلی، آنتروپیک مواد درآمد فصلی و رونوشتهای تماس یک شرکت عمومی را به همراه یک قالب اسلاید در اختیار Sonnet 5.5 قرار داد و از آن خواست یک بررسی عملیاتی ۱۰ اسلایدی ایجاد کند؛ دو کارشناس، پیشنویس اولیه را بدون نیاز به ویرایش بیشتر آماده ارسال تشخیص دادند.
هزینه و سرعت: ۳۰٪ سریعتر و ارزانتر
Sonnet 5.5 از همان قیمتگذاری توکن Sonnet 5 استفاده میکند، اما آنتروپیک اعلام کرده است که معمولاً برای تکمیل همان کار به توکنهای کمتری نیاز دارد. در آزمایشهای این شرکت، این موضوع منجر به کاهش هزینههای وظیفه تا ۳۰٪ نسبت به مدل قبلی شده است. قیمتگذاری توکن به شرح زیر است:
| قیمت هر ۱ میلیون توکن | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| خواندن حافظه پنهان | ۰٫۲۰ دلار | ۰٫۲۹ دلار |
| نوشتن حافظه پنهان | ۲٫۵۰ دلار | ۵ دلار |
| توکن ورودی | ۲ دلار | ۴ دلار |
| توکن خروجی | ۱۰ دلار | ۲۰ دلار |
Sonnet 5.5 خروجیها را بیش از ۳۰٪ سریعتر از Sonnet 5 تولید میکند و آنتروپیک آن را سریعترین مدل Sonnet تا به امروز میداند. کاربران میتوانند سطح تلاش را برای ایجاد تعادل بین هزینه، سرعت و کیفیت خروجی تنظیم کنند. تنظیمات پیشفرض تلاش عبارتند از:
- Claude Code: متوسط
- برنامههای آنتروپیک: متوسط
- پلتفرم Claude: بالا
در تنظیمات پایینتر، مدل سریعتر پاسخ میدهد و توکنهای کمتری مصرف میکند. در تنظیمات بالاتر، مدل برای مدت طولانیتری استدلال میکند و کار خود را با دقت بیشتری بررسی میکند.
امنیت و همترازی
آنتروپیک اعلام کرد که Sonnet 5.5 قابلیتهای مدلهای پیشین را فراتر نمیبرد، بنابراین ارزیابی همترازی آن بر روی خطرات مربوط به مدلها در سطوح مختلف توانایی متمرکز بود. این ارزیابی شامل خطراتی مانند: اقدام علیه منافع کاربران، گمراه کردن کاربران و همکاری در سوءاستفادههای پرخطر میشد.
بازرسی خودکار رفتاری آنتروپیک تقریباً ۱۸۵۰ سناریو را پوشش میدهد. Sonnet 5.5 در اکثر معیارهای همترازی، مقاومت در برابر سوءاستفاده و صداقت، بهتر از Sonnet 5 عمل میکند یا با آن مطابقت دارد. در ارزیابیهای جدیدتر مهار، Sonnet 5.5 از نظر دفعات تلاش برای فرار از sandbox خود، به Opus 5.5 نزدیک شده است. آنتروپیک همچنین اعلام کرد که Sonnet 5.5 کمترین احتمال را در بین مدلهای آزمایششده برای بررسی محدودیتهای کانتینرهای خود داشت. در مجموع بازرسی، Opus 5.5 کمی بهتر عمل کرد.
حفاظتهای امنیتی قویتر
قابلیتهای امنیت سایبری Sonnet 5.5 پیشرفت بزرگی نسبت به Sonnet 5 محسوب میشود و با Opus 5 قابل مقایسه است. به همین دلیل، آنتروپیک این مدل را با حفاظتهایی مشابه آنچه برای Opus 5.5 استفاده میشود، مستقر میکند.
برای امنیت سایبری، این حفاظتها شامل موارد زیر است:
- توسعه نرمافزار روتین و رفع اشکالات همچنان پشتیبانی میشوند.
- وظایف امنیت سایبری با ریسک بالاتر به Sonnet 5 ارجاع داده میشوند.
- مدافعان سایبری به زودی میتوانند برای برنامه تأیید سایبری (Cyber Verification Program) گسترده درخواست دهند. این برنامه دسترسی چندسطحی به قابلیتهای پیشرفته در مدلهای Sonnet 5.5، Opus 5.5 و Claude Mythos را فراهم میکند.
برای زیستشناسی، Sonnet 5.5 از همان حفاظتهای Sonnet 5 استفاده میکند که درخواستهای مضر را هدف قرار میدهند، در حالی که بیشتر کارهای تحقیقاتی، آموزشی و بالینی تحت تأثیر قرار نمیگیرند. سازمانها میتوانند برای برنامه تأیید علوم زیستی (Life Sciences Verification Program) برای دسترسی به حفاظتهای طراحیشده برای پشتیبانی از طیف کامل کارهای مرتبط با زیستشناسی درخواست دهند.
مقابله با استخراج مدل (Distillation)
آنتروپیک همچنین به خطر استخراج مدل (distillation) پرداخته است؛ روشی که در آن هزاران حساب جعلی میتوانند برای استخراج قابلیتهای یک مدل در مقیاس صنعتی استفاده شوند و به مهاجمان اجازه میدهند مدلهای قدرتمندی را بدون حفاظتهای تعبیهشده در Claude ایجاد کنند.
از آنجا که Sonnet 5.5 بهطور قابل توجهی از مدل قبلی خود توانمندتر است، این اولین مدل Sonnet است که با طبقهبندیکنندههای امنیتی (safety classifiers) عرضه میشود که از استخراج استدلال جلوگیری میکنند. همچنین قابلیت حفظ تفکر (preserved thinking) را گسترش میدهد تا تفکر Claude نتواند از حسابی که آن را ایجاد کرده است، جدا شود. این تدابیر عبارتند از:
- طبقهبندیکنندههای امنیتی: از استخراج استدلال از Sonnet 5.5 جلوگیری میکنند.
- تفکر حفظ شده: تفکر Claude نمیتواند از حسابی که آن را ایجاد کرده است، جدا شود.
اکثر توسعهدهندگان متوجه تغییری نخواهند شد، اما انتقال مکالمات بین حسابها ممکن است تحت تأثیر قرار گیرد، از جمله تغییر حسابها در طول یک جلسه Claude Code.
قیمتگذاری و در دسترس بودن
مانند Opus 5.5 و Sonnet 5، مدل Claude Sonnet 5.5 با سیاست حفظ صفر داده (zero data retention) در دسترس است. این مدل اکنون در تمام پلتفرمها از جمله آمازون وب سرویسز (Amazon Web Services)، گوگل کلاد (Google Cloud)، مایکروسافت اژور (Microsoft Azure) و پلتفرم Claude در دسترس قرار دارد. توسعهدهندگان میتوانند با شناسه مدل claude-sonnet-5-5 استفاده از Sonnet 5.5 را در پلتفرم Claude آغاز کنند.
برای توسعهدهندگانی که از Sonnet 5 مهاجرت میکنند: اگر قابلیت تفکر خاموش است، باید قبل از انتقال به Sonnet 5.5، به تنظیمات جدید between_tools سوئیچ کنند. این تنظیم تفکر اولیه را غیرفعال نگه میدارد. آنتروپیک همچنین راهنمای مهاجرتی را برای این انتقال فراهم کرده است. مدل Claude Haiku 5.5 که برای کاربردهای با حجم بالا و حساس به هزینه طراحی شده است، انتظار میرود در هفتههای آینده به خانواده Claude 5.5 بپیوندد.
گجت نیوز آخرین اخبار تکنولوژی، علم و خودرو 





