Claude Sonnet 5.5

مدل هوش‌مصنوعی Claude Sonnet 5.5 آنتروپیک با تمرکز بر کدنویسی و کارهای روزمره معرفی شد

مدل هوش‌مصنوعی Claude Sonnet 5.5 آنتروپیک با افزایش سرعت و کاهش هزینه‌ها برای کارهای روزمره و بهبود بی‌سابقه در کدنویسی رونمایی شد.

شرکت آنتروپیک (Anthropic)، یکی از پیشروان توسعه مدل‌های زبانی بزرگ، اخیراً دومین عضو از خانواده‌ی قدرتمند Claude 5.5 خود را معرفی کرده است. این مدل جدید با نام Sonnet 5.5، به‌طور خاص برای وظایف روزمره با دامنه مشخص و کارایی بالا طراحی شده است. در حالی که مدل Opus 5.5 برای کارهای پیچیده و نیازمند قضاوت دقیق کاربرد دارد، Sonnet 5.5 تعادلی عالی بین قدرت و کارایی ارائه می‌دهد. مدل Haiku 5.5 نیز به‌زودی برای کاربردهای حجیم و کم‌هزینه به این خانواده اضافه خواهد شد.

قابلیت‌های بهبودیافته Claude Sonnet 5.5

Claude Sonnet 5.5 پیشرفت‌های چشمگیری نسبت به مدل Sonnet 5 در زمینه‌های عملکرد، کدنویسی، کار دانش‌بنیان، وظایف طولانی‌مدت، درک تصاویر، همکاری، سرعت و کارایی از خود نشان داده است. آنتروپیک نتایج زیر را گزارش کرده است:

  • Terminal-Bench 4.0: امتیاز ۷۰٫۶٪ برای Sonnet 5.5 در مقایسه با ۱۰٫۳٪ برای Sonnet 5.
  • GDPval-AA: Sonnet 5.5 تنها دو امتیاز کمتر از Opus 5.5 کسب کرده است.
  • وظایف طولانی‌مدت: Sonnet 5.5 در کارهای دانش‌بنیان با افق زمانی طولانی، بهتر از Sonnet 5 و GPT-6 Sol عمل می‌کند.
  • درک تصاویر: این اولین مدل Sonnet است که تنها با استفاده از اسکرین‌شات‌ها توانسته بازی پوکمون رد (Pokémon Red) را شکست دهد.

Claude Sonnet 5.5

Sonnet 5.5 می‌تواند در سطوح تلاش مختلفی عمل کند که تعادل بین هزینه، سرعت و کیفیت خروجی را تغییر می‌دهد. آنتروپیک اعلام کرده است در چندین ارزیابی، Sonnet 5.5 با حداکثر تلاش (Max effort) عملکردی مشابه Opus 5.5 ارائه داده، در حالی که با تلاش پایین یا متوسط (Low or Medium effort)، می‌تواند بهترین امتیاز Sonnet 5 را در برخی بنچمارک‌ها با حدود یک دهم هزینه هر وظیفه شکست دهد.

کدنویسی پیشرفته و بهبود بهره‌وری

آنتروپیک همچنین نتایج چشمگیری در زمینه‌ی کدنویسی برای Sonnet 5.5 گزارش کرده است:

  • FrontierCode: در سطح تلاش بالا (High effort)، این مدل ۱۰ امتیاز بیشتر از Sonnet 5 در همین تنظیمات کسب کرده و هزینه هر وظیفه را به حدود یک پانزدهم کاهش داده است.
  • CursorBench: بهترین امتیاز آن در وظایف برگرفته از جلسات کدنویسی واقعی Cursor، تنها حدود دو امتیاز با Opus 5.5 فاصله دارد.

آزمایش‌کنندگان اولیه گزارش دادند که Sonnet 5.5 می‌تواند به سرعت یک پایگاه کد (codebase) را درک کند. در آزمایش‌های مستقیم، این مدل همچنین فراخوانی ابزارها را بیشتر از Sonnet 5 دسته‌بندی می‌کرد که منجر به گام‌های کمتر و هزینه‌های پایین‌تر می‌شد.

Claude Sonnet 5.5

کار دانش‌بنیان و توانایی‌های جدید

Sonnet 5.5 در چندین حوزه‌ی کار دانش‌بنیان نیز بهبود یافته است. آنتروپیک گزارش داد که این مدل در GDPval-AA، که وظایف دنیای واقعی را در ۴۴ شغل و ۹ صنعت اصلی پوشش می‌دهد، تقریباً هم‌سطح Opus 5.5 عمل کرده و حدود ۴۰۰ امتیاز بالاتر از Sonnet 5 قرار گرفته است. این مدل همچنین در استفاده از کامپیوتر و تشخیص نمودارها به Opus 5.5 نزدیک است و در کارهای دانش‌بنیان طولانی‌مدت، عملکردی بهتر از Sonnet 5 و GPT-6 Sol از خود نشان می‌دهد.

Claude Sonnet 5.5

آزمایش‌کنندگان اولیه نیز تغییراتی را در مکالمات و وظایف مرتبط با طراحی گزارش کردند، از جمله پیروی از قالب‌های اسلاید هنگام ساخت ارائه‌ها. در یک آزمایش داخلی، آنتروپیک مواد درآمد فصلی و رونوشت‌های تماس یک شرکت عمومی را به همراه یک قالب اسلاید در اختیار Sonnet 5.5 قرار داد و از آن خواست یک بررسی عملیاتی ۱۰ اسلایدی ایجاد کند؛ دو کارشناس، پیش‌نویس اولیه را بدون نیاز به ویرایش بیشتر آماده ارسال تشخیص دادند.

بیشتر بخوانید

هزینه و سرعت: ۳۰٪ سریع‌تر و ارزان‌تر

Sonnet 5.5 از همان قیمت‌گذاری توکن Sonnet 5 استفاده می‌کند، اما آنتروپیک اعلام کرده است که معمولاً برای تکمیل همان کار به توکن‌های کمتری نیاز دارد. در آزمایش‌های این شرکت، این موضوع منجر به کاهش هزینه‌های وظیفه تا ۳۰٪ نسبت به مدل قبلی شده است. قیمت‌گذاری توکن به شرح زیر است:

قیمت هر ۱ میلیون توکنClaude Sonnet 5.5Claude Opus 5.5
خواندن حافظه پنهان۰٫۲۰ دلار۰٫۲۹ دلار
نوشتن حافظه پنهان۲٫۵۰ دلار۵ دلار
توکن ورودی۲ دلار۴ دلار
توکن خروجی۱۰ دلار۲۰ دلار

Sonnet 5.5 خروجی‌ها را بیش از ۳۰٪ سریع‌تر از Sonnet 5 تولید می‌کند و آنتروپیک آن را سریع‌ترین مدل Sonnet تا به امروز می‌داند. کاربران می‌توانند سطح تلاش را برای ایجاد تعادل بین هزینه، سرعت و کیفیت خروجی تنظیم کنند. تنظیمات پیش‌فرض تلاش عبارتند از:

  • Claude Code: متوسط
  • برنامه‌های آنتروپیک: متوسط
  • پلتفرم Claude: بالا

در تنظیمات پایین‌تر، مدل سریع‌تر پاسخ می‌دهد و توکن‌های کمتری مصرف می‌کند. در تنظیمات بالاتر، مدل برای مدت طولانی‌تری استدلال می‌کند و کار خود را با دقت بیشتری بررسی می‌کند.

امنیت و هم‌ترازی

آنتروپیک اعلام کرد که Sonnet 5.5 قابلیت‌های مدل‌های پیشین را فراتر نمی‌برد، بنابراین ارزیابی هم‌ترازی آن بر روی خطرات مربوط به مدل‌ها در سطوح مختلف توانایی متمرکز بود. این ارزیابی شامل خطراتی مانند: اقدام علیه منافع کاربران، گمراه کردن کاربران و همکاری در سوءاستفاده‌های پرخطر می‌شد.

بازرسی خودکار رفتاری آنتروپیک تقریباً ۱۸۵۰ سناریو را پوشش می‌دهد. Sonnet 5.5 در اکثر معیارهای هم‌ترازی، مقاومت در برابر سوءاستفاده و صداقت، بهتر از Sonnet 5 عمل می‌کند یا با آن مطابقت دارد. در ارزیابی‌های جدیدتر مهار، Sonnet 5.5 از نظر دفعات تلاش برای فرار از sandbox خود، به Opus 5.5 نزدیک شده است. آنتروپیک همچنین اعلام کرد که Sonnet 5.5 کمترین احتمال را در بین مدل‌های آزمایش‌شده برای بررسی محدودیت‌های کانتینرهای خود داشت. در مجموع بازرسی، Opus 5.5 کمی بهتر عمل کرد.

حفاظت‌های امنیتی قوی‌تر

قابلیت‌های امنیت سایبری Sonnet 5.5 پیشرفت بزرگی نسبت به Sonnet 5 محسوب می‌شود و با Opus 5 قابل مقایسه است. به همین دلیل، آنتروپیک این مدل را با حفاظت‌هایی مشابه آنچه برای Opus 5.5 استفاده می‌شود، مستقر می‌کند.

Claude Sonnet 5.5

برای امنیت سایبری، این حفاظت‌ها شامل موارد زیر است:

  • توسعه نرم‌افزار روتین و رفع اشکالات همچنان پشتیبانی می‌شوند.
  • وظایف امنیت سایبری با ریسک بالاتر به Sonnet 5 ارجاع داده می‌شوند.
  • مدافعان سایبری به زودی می‌توانند برای برنامه تأیید سایبری (Cyber Verification Program) گسترده درخواست دهند. این برنامه دسترسی چندسطحی به قابلیت‌های پیشرفته در مدل‌های Sonnet 5.5، Opus 5.5 و Claude Mythos را فراهم می‌کند.

برای زیست‌شناسی، Sonnet 5.5 از همان حفاظت‌های Sonnet 5 استفاده می‌کند که درخواست‌های مضر را هدف قرار می‌دهند، در حالی که بیشتر کارهای تحقیقاتی، آموزشی و بالینی تحت تأثیر قرار نمی‌گیرند. سازمان‌ها می‌توانند برای برنامه تأیید علوم زیستی (Life Sciences Verification Program) برای دسترسی به حفاظت‌های طراحی‌شده برای پشتیبانی از طیف کامل کارهای مرتبط با زیست‌شناسی درخواست دهند.

مقابله با استخراج مدل (Distillation)

آنتروپیک همچنین به خطر استخراج مدل (distillation) پرداخته است؛ روشی که در آن هزاران حساب جعلی می‌توانند برای استخراج قابلیت‌های یک مدل در مقیاس صنعتی استفاده شوند و به مهاجمان اجازه می‌دهند مدل‌های قدرتمندی را بدون حفاظت‌های تعبیه‌شده در Claude ایجاد کنند.

از آنجا که Sonnet 5.5 به‌طور قابل توجهی از مدل قبلی خود توانمندتر است، این اولین مدل Sonnet است که با طبقه‌بندی‌کننده‌های امنیتی (safety classifiers) عرضه می‌شود که از استخراج استدلال جلوگیری می‌کنند. همچنین قابلیت حفظ تفکر (preserved thinking) را گسترش می‌دهد تا تفکر Claude نتواند از حسابی که آن را ایجاد کرده است، جدا شود. این تدابیر عبارتند از:

  • طبقه‌بندی‌کننده‌های امنیتی: از استخراج استدلال از Sonnet 5.5 جلوگیری می‌کنند.
  • تفکر حفظ شده: تفکر Claude نمی‌تواند از حسابی که آن را ایجاد کرده است، جدا شود.

اکثر توسعه‌دهندگان متوجه تغییری نخواهند شد، اما انتقال مکالمات بین حساب‌ها ممکن است تحت تأثیر قرار گیرد، از جمله تغییر حساب‌ها در طول یک جلسه Claude Code.

قیمت‌گذاری و در دسترس بودن

مانند Opus 5.5 و Sonnet 5، مدل Claude Sonnet 5.5 با سیاست حفظ صفر داده (zero data retention) در دسترس است. این مدل اکنون در تمام پلتفرم‌ها از جمله آمازون وب سرویسز (Amazon Web Services)، گوگل کلاد (Google Cloud)، مایکروسافت اژور (Microsoft Azure) و پلتفرم Claude در دسترس قرار دارد. توسعه‌دهندگان می‌توانند با شناسه مدل claude-sonnet-5-5 استفاده از Sonnet 5.5 را در پلتفرم Claude آغاز کنند.

برای توسعه‌دهندگانی که از Sonnet 5 مهاجرت می‌کنند: اگر قابلیت تفکر خاموش است، باید قبل از انتقال به Sonnet 5.5، به تنظیمات جدید between_tools سوئیچ کنند. این تنظیم تفکر اولیه را غیرفعال نگه می‌دارد. آنتروپیک همچنین راهنمای مهاجرتی را برای این انتقال فراهم کرده است. مدل Claude Haiku 5.5 که برای کاربردهای با حجم بالا و حساس به هزینه طراحی شده است، انتظار می‌رود در هفته‌های آینده به خانواده Claude 5.5 بپیوندد.

0 دیدگاه
جدیدترین
قدیمی ترین بیشترین رای
بازخورد درون خطی
مشاهده همه نظرات