هووورا

اکران رسمی نسخه جدید بیت گرف

۲ روز و ۰۸:۳۹
هوش مصنوعی

بررسی Claude Opus 5: چه چیزی عوض شد و کجا هنوز کم می‌آورد؟

نتایج بنچمارک‌ها، قیمت، پنجره یک میلیون توکنی، تفاوت با Opus 4.8 و محدودیت‌هایی که پیش از مهاجرت باید بدانید.

ارسطو اعتمادی
۱۵ مرداد ۱۴۰۵ · 12 دقیقه مطالعه
بررسی Claude Opus 5: چه چیزی عوض شد و کجا هنوز کم می‌آورد؟

آنتروپیک مدل تازه‌اش، Claude Opus 5، را منتشر کرده و جالب اینکه قیمتش دست‌نخورده مانده: هر میلیون توکن ورودی ۵ دلار و هر میلیون توکن خروجی ۲۵ دلار، دقیقاً مثل نسل قبلی یعنی Opus 4.8. (توکن واحد شمارش متن است و هر توکن تقریباً معادل چند حرف؛ شرکت‌های هوش مصنوعی بر همین اساس صورتحساب می‌دهند.) پس آنچه عوض شده قیمت نیست، حجم کاری است که با همان پول از مدل می‌گیرید.

مشخصات پایه opus 5

  • شناسه مدل در API: claude-opus-5
  • پنجره زمینه: ۱ میلیون توکن، یعنی حجم متنی که مدل می‌تواند یک‌جا جلوی چشمش داشته باشد. این عدد هم پیش‌فرض است و هم سقف.
  • حداکثر خروجی: ۱۲۸ هزار توکن در یک پاسخ
  • تفکر (thinking): پیش‌فرض روشن است، یعنی مدل قبل از جواب دادن برای خودش فکر می‌کند و بابت آن فکر کردن هم توکن مصرف می‌شود
  • سطح تلاش (effort): پنج پله از low تا max، با پیش‌فرض high. هرچه بالاتر بروید مدل عمیق‌تر فکر می‌کند و طبیعتاً گران‌تر و کندتر می‌شود.
  • در دسترس روی: Claude API، Amazon Bedrock، Google Cloud و Microsoft Foundry

برای OPUS 5 در آزمون‌ها چه اتفاقی افتاد؟

در آزمون Frontier-Bench v0.1، که کارهای واقعی مهندسی نرم‌افزار را به مدل می‌سپارد، Opus 5 نمره‌ای بیش از دو برابر Opus 4.8 گرفته، آن هم با هزینه کمتر برای هر تسک. در CursorBench 3.2 و با بالاترین سطح تلاش، فاصله‌اش با بهترین نمره Fable 5 (گران‌ترین و قدرتمندترین مدل عمومی آنتروپیک) به کمتر از نیم درصد رسیده؛ با نصف هزینه.

عملکرد نسبت به هزینه روی Frontier-Bench v0.1، در سطوح مختلف effort. منبع: Anthropic

در ARC-AGI 3، که عمداً مسئله‌هایی می‌دهد که مدل شبیه‌شان را قبلاً ندیده، نمره Opus 5 سه برابر نزدیک‌ترین رقیبش است. در AutomationBench شرکت Zapier، که می‌سنجد مدل یک کار اداری را از ابتدا تا انتها تمام می‌کند یا نه، نرخ موفقیتش حدود ۱.۵ برابر بهترین رقیب با همان هزینه است. در OSWorld 2.0 هم که مدل باید مستقیم با کامپیوتر کار کند، بهترین نتیجه Fable 5 را با کمی بیش از یک‌سوم هزینه پشت سر گذاشته.

نتایج ARC-AGI 3، ارزیابی حل مسائل تازه. منبع: Anthropic

در علوم زیستی هم آنتروپیک می‌گوید Opus 5 در تمام ارزیابی‌های داخلی این حوزه از Opus 4.8 جلوتر بوده. بیشترین اختلاف در شیمی آلی دیده شده (یعنی حدس زدن ساختار یک مولکول از روی داده‌های آزمایشگاهی) با ۱۰.۲ واحد درصد نمره بالاتر. بعد از آن کارهای مربوط به پروتئین قرار دارد (پیش‌بینی اینکه تغییر در ساختار یک پروتئین چطور رفتارش را عوض می‌کند) با ۷.۷ واحد درصد اختلاف.

همسویی و ایمنی

آنتروپیک پیش از انتشار، مدل را از یک ممیزی رفتاری خودکار رد می‌کند تا ببیند چقدر از قواعد خودش تخلف می‌کند. Opus 5 در این ممیزی نمره ۲.۳ گرفته که پایین‌ترین عدد بین مدل‌های اخیر این شرکت است و اینجا عدد کمتر یعنی بهتر. طبق همین گزارش، کمترین نرخ رفتار فریبکارانه را دارد و سخت‌تر از بقیه با ترفند به سوءاستفاده کشیده می‌شود. فقط یادتان باشد این ارزیابی داخلی خود آنتروپیک است، نه ممیزی یک نهاد مستقل.

نمره رفتار ناهمسو در ممیزی رفتاری خودکار؛ عدد کمتر بهتر است. منبع: Anthropic

رفتار مدل عوض شده، نه فقط نمره‌اش

اگر از Opus 4.8 مهاجرت می‌کنید، این سه تغییر بیشتر از اعداد بنچمارک به کارتان می‌آید، چون بدون اینکه یک خط کد عوض کنید خودشان را نشان می‌دهند.

تفکر پیش‌فرض روشن است:
نکته مهم اینجاست که max_tokens سقف کل خروجی است، یعنی هم فکر کردن مدل را حساب می‌کند و هم متن نهایی پاسخ را. پس اگر قبلاً درخواستی داشتید که بدون فکر کردن اجرا می‌شد و حالا این قابلیت پیش‌فرض روشن است، ممکن است همان درخواست به سقف بخورد و پاسخ ناقص برگردد. بهتر است این عدد را یک بار دوباره تنظیم کنید.

دستورهای راستی‌آزمایی قدیمی را حذف کنید:
Opus 5 بدون اینکه از او بخواهید کار خودش را بازبینی می‌کند. پس جمله‌هایی مثل «یک مرحله بررسی نهایی اضافه کن» که از پرامپت‌های نسل قبل باقی مانده، حالا باعث بازبینی بیش از حد می‌شود و نتیجه‌اش فقط توکن و زمان اضافه است.

پاسخ‌ها طولانی‌تر شده‌اند:
مدل به‌صورت پیش‌فرض متن بلندتری می‌نویسد، در کارهای چندمرحله‌ای بیشتر گزارش پیشرفت می‌دهد و راحت‌تر بخشی از کار را به زیرایجنت‌ها می‌سپارد (یعنی نسخه‌های کمکی خودش که هرکدام تکه‌ای از کار را جدا انجام می‌دهند). برای پروژه‌های بزرگ این خبر خوبی است، ولی اگر کار شما کوتاه و ساده است، بابت خروجی‌ای پول می‌دهید که لازمش نداشتید.

چیزهای تازه‌ای که کنار هوش مصنوعی اوپوس 5 آمد

  • تغییر ابزارها وسط مکالمه (نسخه آزمایشی): می‌توانید بین نوبت‌ها ابزاری را اضافه یا حذف کنید بدون اینکه کش پرامپت از بین برود. کش پرامپت یعنی بخش‌های ثابت درخواست یک بار ذخیره می‌شود تا دفعه بعد ارزان‌تر و سریع‌تر پردازش شود.
  • حداقل طول کش از ۱۰۲۴ به ۵۱۲ توکن رسیده: پرامپت‌های کوتاهی که قبلاً برای کش شدن خیلی کوچک بودند حالا کش می‌شوند، بدون تغییر در کد شما.
  • برگشت خودکار به مدل دیگر: اگر سیستم‌های ایمنی درخواستی را علامت بزنند، درخواست بلاک نمی‌شود و به مدل دیگری می‌رود، یعنی کاربر شما دست‌خالی نمی‌ماند.
  • حالت Fast: حدود ۲.۵ برابر سریع‌تر، با دو برابر قیمت پایه یعنی ۱۰ و ۵۰ دلار. فعلاً هم فقط روی Claude API فعال است، نه روی Bedrock و Google Cloud و Microsoft Foundry.

کجاها باید حواستان باشد

این‌ها را خود آنتروپیک هم در اعلامیه و مستنداتش نوشته و دقیقاً همان بخش‌هایی است که در مرور اولیه از قلم می‌افتد.

سایبرسکیوریتی - محدودیت‌های امنیت سایبری
Opus 5 در پیدا کردن آسیب‌پذیری تقریباً به Mythos 5 (قوی‌ترین رده مدل‌های آنتروپیک که در دسترس عموم نیست) رسیده، ولی در نوشتن اکسپلویت، یعنی کدی که از آن آسیب‌پذیری واقعاً سوءاستفاده می‌کند، هنوز خیلی عقب‌تر است. جدا از این، سیستم‌های تشخیص خود مدل اسکن باینری، تست نفوذ و تولید اکسپلویت را می‌بندند. اثر عملی‌اش این است که در Claude.ai و Claude Code و Cowork، درخواست علامت‌خورده (فلگ شده) به Opus 4.8 برمی‌گردد و برای آن یک درخواست عملاً مدل ضعیف‌تری جوابتان را می‌دهد. آنتروپیک تخمین زده این تشخیص‌دهنده‌ها حدود ۸۵ درصد کمتر از Fable 5 فعال می‌شوند.

در آزمون OSS-Fuzz، فاصله Opus 5 با Mythos 5 در پیدا کردن آسیب‌پذیری کم است (چپ)، ولی در ساختن اکسپلویت زیاد (راست). منبع: Anthropic

محدودیت در کارهای زیستی طولانی
Opus 5 توانمندترین مدل عمومی آنتروپیک برای پژوهش علمی است، ولی خود شرکت می‌گوید روی پژوهش‌های طولانی و خودگردان هنوز محدودیت جدی دارد. پس اگر پروژه‌تان یک زنجیره چندروزه از آزمایش و تحلیل است، انتظار نداشته باشید مدل بدون نظارت شما تا انتها برود.

یک تغییر شکننده در API
روی Opus 5 خاموش کردن تفکر فقط تا سطح تلاش high پذیرفته می‌شود. اگر همان کار را با xhigh یا max انجام دهید، به‌جای پاسخ، خطای ۴۰۰ می‌گیرید و این یعنی کدی که روی نسل قبل بی‌مشکل کار می‌کرد ممکن است از کار بیفتد. ضمناً وقتی تفکر خاموش باشد، مدل گاهی به‌جای فراخوانی درست ابزار، متن آن فراخوانی را وسط پاسخ می‌نویسد یا تگ‌های داخلی‌اش را بیرون می‌ریزد، که برای هر سیستمی که خروجی را خودکار پردازش می‌کند دردسر است.

محدودیت حالت Fast
حالت Fast فعلاً فقط روی Claude API فعال است، نه روی Bedrock، Google Cloud و Microsoft Foundry.

منبع اعداد
تقریباً تمام ارقام این مقاله را خود آنتروپیک یا مشتریان دسترسی زودهنگامش منتشر کرده‌اند و در زمان انتشار، آزمون مستقل شخص ثالث کم بود. پس این اعداد را نقطه شروع بگیرید نه نتیجه قطعی، و پیش از مهاجرت کامل، مدل را روی داده و کار واقعی خودتان امتحان کنید.

مدل OPUS 5 برای چه کاری ارزش دارد

اگر کارتان کدنویسی چندفایلی، بازنویسی بخش‌های بزرگ یک پروژه، مرور کد و پیدا کردن باگ، تحلیل روی متن‌های حجیم یا ایجنت‌های چندمرحله‌ای طولانی است، اختلاف با Opus 4.8 را در همان روزهای اول حس می‌کنید و قیمت هم بالا نرفته. اما اگر کارتان دسته‌بندی متن، خلاصه‌نویسی کوتاه یا پاسخ‌های ساده است، Opus 5 هم گران است و هم پرحرف؛ در این حالت Sonnet 5 انتخاب عاقلانه‌تری است.

مهاجرت از Opus 4.8

در کد فقط کافی است شناسه مدل را عوض کنید:

JavaScript
model = "claude-opus-4-8"  # قبل
model = "claude-opus-5"    # بعد

اما همین یک خط، دو رفتار پنهان را هم با خودش می‌آورد که ارزش بررسی دارد. اول اینکه چون تفکر حالا پیش‌فرض روشن است، ممکن است به سقف max_tokens بخورید و پاسخ نصفه بماند، پس این عدد را بالاتر ببرید. دوم اینکه اگر عادت دارید تفکر را خاموش کنید، این کار فقط تا سطح تلاش high جواب می‌دهد و در سطوح بالاتر با خطا روبه‌رو می‌شوید؛ یا سطح تلاش را پایین بیاورید یا تفکر را روشن بگذارید و هزینه را با همان سطح تلاش کنترل کنید.

۸ آتیش۰ دیدگاه19 بازدید
ارسطو اعتمادی
۶۹۳ مقاله۱۲ دنبال‌کننده

کارشناس ارشد مهندسی مواد از دانشگاه تبریز. از ۱۳۹۰ در حوزه عکاسی و گرافیک‌ام؛ آنچه دلبستگی بود، حرفه شد. بیت گرف را ساختم، از دستش دادم و دوباره ( این‌بار استوارتر) از نو بنا کردم. مقصد روشن است: مرجعی جامع برای آموزش گرافیک، هوش مصنوعی و کد.

گفتگو و سوالات شما

۰

در این قسمت می‌توانید سوال یا نظر خود در مورد مقاله را مطرح کنید.

برای ثبت دیدگاه ابتدا وارد شوید

ورود به حساب

هنوز دیدگاهی ثبت نشده. اولین نفر باشید!

مقالات مرتبط

اگر این را دوست داشتید، ترتیب خواندن بعدی این است

این مقاله‌ها روی «Claude» هم‌پوشانی دارند، مجموع زمان مطالعه ۶۹ دقیقه

مشاهده همه
  1. Claude و ۱ برچسب دیگر

    معرفی Qwen 3.6؛ خانواده‌ای از مدل‌های هوش مصنوعی که Claude و GPT را به چالش کشید

    علی‌بابا با انتشار خانواده‌ی Qwen 3.6 وارد رقابت جدی با Claude و GPT شده است. این مقاله سه نسخه‌ی Max، Plus و 35B-A3B را معرفی می‌کند، بنچمارک‌های کلیدی را بررسی می‌کند. نسخه‌ی متن‌باز در انتهای مقال…

    ارسطو اعتمادی۱ اردیبهشت۱۶ دقیقه
  2. Claude و ۱ برچسب دیگر

    هوش مصنوعی‌های داخلی در زمان قطع اینترنت: راهکارهای موقت و کاربردی

    در نبود یا قطعی اینترنت، نگران دسترسی به هوش مصنوعی خواهیم بود! راهکارهای جایگزین اگرچه سرعتشون کمتره، اما برای کارهای ساده می توانند موثر باشند.

    ارسطو اعتمادی۲۶ دی۶ دقیقه
  3. Claude و ۱ برچسب دیگر

    مدل های Claude و انتخاب درست: کدام مدل برای کار تو مناسبه؟

    انتخاب مدل مناسب در خانواده Claude ۴ (Opus، Sonnet و Haiku) بر اساس بازدهی سرمایه و نوع کار تعیین می‌شود، نه صرفاً قدرت مدل. برای ۹۰٪ کارهای روزمره و برنامه‌نویسی معمول، Sonnet 4.6 با هزینه کمتر و سر…

    ارسطو اعتمادی۹ اردیبهشت۱۰ دقیقه
  4. Claude و ۱ برچسب دیگر

    پرامپت نویسی برای Claude؛ راهنمای جامع ۱۰ تکنیک عملی برای طراحان

    این مقاله با تأکید بر اهمیت پرامپت‌نویسی دقیق، تفاوت خروجی‌های متوسط و عالی را در استفاده از Claude نشان می‌دهد. با معرفی ۱۰ تکنیک عملی از شفافیت تا زنجیره تفکر، به طراحان ابزارهایی برای افزایش کیفیت…

    ارسطو اعتمادی۱۶ اردیبهشت۳۷ دقیقه
۰

دوره به سبد ثبت‌نام اضافه شد

رفتن به سبد