اخبار

GPT-6 Astra منتشر شد: هرچه OpenAI اعلام کرد، و هرچه اعلام نکرد

مدل جدید OpenAI یعنی GPT-6 Astra منتشر شد. بنچمارک‌های واقعی، مقایسه با Claude Fable 5.1، قیمت، و جاهایی که ادعاها مشکوک است.

ارسطو اعتمادی ملکی
۱۹ شهریور ۱۴۰۵ · 18 دقیقه مطالعه
GPT-6 Astra منتشر شد: هرچه OpenAI اعلام کرد، و هرچه اعلام نکرد

OpenAI مدل پرچم‌دار تازه‌اش را داد بیرون، رئیس شرکت در جلسه خبری گفت «به عصر AGI خوش آمدید»، و دو روز قبلش Anthropic هم Claude Fable 5.1 را منتشر کرده بود. اینجا اعداد هر دو را کنار هم می‌گذاریم، از جمله اعدادی که Astra در آن‌ها عقب است.

OpenAI روز پنجشنبه ۳ سپتامبر ۲۰۲۶ مدل GPT-6 Astra را منتشر کرد. Astra جانشین GPT-5.6 Sol است و اولین مدلی است که این شرکت آن را در چارچوب آمادگی خودش (Preparedness Framework) در سطح «بحرانی» یا Critical برای توانایی سایبری طبقه‌بندی کرده. انتشار اولیه محدود بود: فقط تعداد کمی سازمان، و مشتریان برنامه امنیتی Daybreak. دسترسی کاربران ChatGPT Plus، Pro، Business و Enterprise قرار است طی روزهای بعد باز شود. طبق گزارش کاربران این دسترسی در حال ایجاد است.

سم آلتمن در X نوشت که Astra به باور آن‌ها بهترین مدل دنیا برای کار با کامپیوتر، کار حرفه‌ای، علم، کدنویسی و امنیت سایبری است، و اینکه انتشارش «کمی بیشتر طول کشید» تا استانداردهای ایمنی این سطح از توانایی برآورده شود. گرگ براکمن، رئیس OpenAI، در جلسه خبری جمله‌ای گفت که تیتر خیلی از خبرها شد: «به عصر AGI خوش آمدید.» خودش بعداً روشن کرد که این یک اعلام رسمی نیست؛ فقط می‌گوید بعید نیست که ما همین الان داخل آن دوره باشیم. تعریف رسمی خود OpenAI از AGI سیستمی است که در بیشتر مدل جدید OpenAI Astraکارهای دارای ارزش اقتصادی از انسان بهتر عمل کند، و شرکت هیچ شواهدی منتشر نکرده که Astra از این خط رد شده باشد.منظور از AGI (Artificial General Intelligence)، هوش مصنوعی‌ای است که بتواند در طیف بسیار گسترده‌ای از کارهای فکری، مثل یک انسان توانمند، یاد بگیرد، استدلال کند، مسئله حل کند و خودش را با مسائل جدید تطبیق دهد؛ نه اینکه فقط برای یک کار مشخص ساخته شده باشد.

آینده هوش مصنوعی فقط سریع‌تر شدن مدل‌ها نیست. OpenAI در این ویدیو نگاهش به نسل جدید مدل‌های هوش مصنوعی و قابلیت‌هایی که در حال شکل گرفتن هستند را نشان می‌دهد. اگر می‌خواهید ببینید OpenAI مسیر AI را به کدام سمت می‌برد، این ویدیو را با زیرنویس فارسی بیت گرف ببینید.

اسم Astra از کجا آمد

Astra یک‌شبه ظاهر نشد. OpenAI اسمش را اول اوت ۲۰۲۶ و آن هم داخل یک پست پژوهشی درباره ریاضیات تأیید کرد، نه در یک رویداد معرفی محصول. در آن گزارش گفت نسخه‌ای داخلی از Astra ده مسئله باز ریاضی و علوم کامپیوتر نظری را حل کرده؛ مسئله‌هایی که دست‌کم یک دهه، و در بیشتر موارد خیلی بیشتر، کسی رویشان پیشرفتی نکرده بود.

در روز انتشار، OpenAI دو نتیجه تازه دیگر هم درباره فاصله اعداد اول اضافه کرد. یکی از آن‌ها کران شناخته‌شده برای فاصله جفت‌های اعداد اول را از ۲۴۰ به ۱۸۶ رساند، و دیگری یک جمله در کران فاصله‌های بزرگ بین اعداد اول را بهبود داد که بیش از ۸۰ سال دست‌نخورده مانده بود.

Astra عملاً چه کار می‌کند

هدف اصلی این نسخه «کار با کامپیوتر» است، یعنی همان چیزی که به آن computer use می‌گویند: مدل به‌جای اینکه فقط متن جواب بدهد، خودش صفحه را می‌بیند، کلیک می‌کند، فرم پر می‌کند و بین نرم‌افزارها جابه‌جا می‌شود. OpenAI مثال‌هایش را کاملاً روزمره انتخاب کرده: پر کردن فرم‌های آنلاین، به‌روز کردن رکورد مشتری در CRM، مرتب کردن تقویم، جست‌وجوی اینترنتی و نوشتن خلاصه‌اش داخل ایمیل یا ویرایشگر متن، و تست کردن ظاهر یک سایت بعد از ساختنش.

عدد این بخش قابل لمس‌تر از بقیه است. در شبیه‌سازی تأخیر روی بنچمارک OSWorld 2.0، مدل نمره ۷۲.۶ درصد را در حدود ۴۰ دقیقه برای هر تسک گرفته، در برابر ۶۵.۷ درصد در حدود ۷۵ دقیقه برای Sol. یعنی هم نمره بالاتر، هم حدود ۴۷ درصد زمان کمتر. OpenAI همزمان هارنس Codex را هم به‌روز کرد و می‌گوید ترکیب این دو، روی بنچمارک Mind2Web، کارها را ۱.۹ برابر سریع‌تر از تجربه فعلی Sol تمام می‌کند. برای کاربر معمولی معنی‌اش این است که کاری مثل گشتن دنبال آپارتمان که به‌طور معمول حدود شش ساعت وقت می‌برد، طبق مثال خود شرکت می‌تواند زیر ده دقیقه تمام شود؛ البته این یک نمونه‌ی انتخابی از سوی سازنده است، نه میانگین یک آزمون مستقل.

بخش دوم، کار حرفه‌ای است. Astra برای تولید خروجی‌های قابل تحویل آموزش دیده: اسلاید، سند، صفحه‌گسترده و تحلیل، آن هم با پیروی از قالب و لحن خود شما. در نمایش شرکت، مدل با گرفتن فقط چند اسلاید از قالب ارائه OpenAI، یک ارائه کامل ساخته که لحن و چیدمانش با بقیه هماهنگ بوده. نکته‌ی کاربردی‌اش این است که خروجی معمولاً لازم نیست دوباره از اول قالب‌بندی شود.

سومین تغییر مهم مخصوص برنامه‌نویس‌هاست. تا امروز وقتی پنجره‌ی زمینه‌ی یک مدل پر می‌شد، ابزارها از compaction استفاده می‌کردند، یعنی کل گفت‌وگوی قبلی را در یک خلاصه فشرده می‌کردند. مشکل این روش این است که هر بار فشرده‌سازی، جزئیاتی مثل «چرا آن راه‌حل قبلی جواب نداد» را دور می‌ریزد. در Codex، مدل حالا می‌تواند بین پنجره‌های زمینه یادداشت نگه دارد و پنجره‌های قبلی هم قابل جست‌وجو می‌مانند. پس اگر ساعت‌ها روی یک باگ کار کرده‌اید، مدل به‌جای فراموش کردن مسیر شکست‌خورده، می‌تواند برگردد و همان را پیدا کند. این قابلیت فعلاً آزمایشی است و باید در فایل config.toml روشنش کنید.

عددها، و جایی که باید احتیاط کرد

OpenAI سه عدد را جلوی همه گذاشت: ۹۷.۶ درصد در FrontierMath Tier 4 و ۹۹.۹ درصد در ARC-AGI-3 و ۱۰۰ درصد در ExploitBench. عدد دوم همان جایی است که باید مکث کرد.

Terminal-Bench Science 0.1 ارزیابی می‌کند که آیا عامل‌های هوش مصنوعی می‌توانند فرایندهای پژوهش علمی را با استفاده از کدنویسی و ابزارهای ترمینال به‌طور کامل انجام دهند یا نه؛ فرایندهایی مانند تحلیل داده‌ها، اجرای شبیه‌سازی‌ها و برازش مدل‌های علمی. در این ارزیابی، GPT-6 Astra با ثبت امتیاز ۶۴.۶٪ به بالاترین نتیجه در میان مدل‌های مقایسه‌شده دست یافته است؛ در حالی که Claude Fable 5.1 امتیاز ۵۲.۶٪ را کسب کرده. نکته قابل‌توجه این است که هزینه تخمینی استفاده از API برای Astra در این سطح، حدود ۳۱٪ کمتر بوده است. در یک تنظیمات کم‌هزینه‌تر نیز Astra توانسته به امتیاز ۶۱.۱٪ برسد؛ در مقابل، بهترین نتیجه ثبت‌شده برای GPT-5.6 Sol برابر با ۲۲.۴٪ بوده است. در این حالت هم هزینه تخمینی API برای Astra حدود ۲۷٪ کمتر گزارش شده است.

نمره ۹۹.۹ درصدی ARC-AGI-3 با هارنسی به نام Provider Adapter گرفته شده که استدلال مدل را بین نوبت‌ها زنده نگه می‌دارد. «هارنس» یعنی همان لایه‌ی نرم‌افزاری دور مدل که ابزارها، حافظه و شیوه‌ی اجرای آزمون را تعیین می‌کند. با هارنس استاندارد خود بنچمارک، Astra نمره ۶۲.۷ درصد گرفته. هر دو عدد درست‌اند، ولی یک چیز را نمی‌گویند: بخش بزرگی از این جهش، به‌جای خود مدل، از زیرساخت اطرافش می‌آید. پس اگر با API خام کار می‌کنید و همان هارنس را ندارید، انتظار عدد ۹۹.۹ را نداشته باشید.

منبع https://openai.com/index/gpt-6-astra

فاصله‌ی Astra با Fable 5.1 در این آزمون ۲.۱ واحد درصد است، یعنی نزدیک. جایی که فاصله واقعاً باز می‌شود، کارهای پژوهشی است.

هزینه‌ی تخمینی API مدل GPT-6 آسترا حدود ۳۱ درصد کمتر از Fable 5.1 است.

مقایسه GPT 6 Astra با Claude Fable 5.1

Anthropic دو روز قبل از OpenAI، در اول سپتامبر، مدل‌های Claude Fable 5.1 و Claude Mythos 5.1 را منتشر کرد. این دو در واقع یک مدل‌اند با دو سطح متفاوت از محافظ‌ها: Fable 5.1 برای همه در دسترس است، و Mythos 5.1 فقط برای افراد و سازمان‌های تأییدشده‌ی آمریکایی در برنامه‌های دسترسی مورد اعتماد، آن هم برای کار امنیت سایبری دفاعی و علوم زیستی. هر دو پنجره‌ی زمینه‌ی یک میلیون توکنی و سقف خروجی ۱۲۸ هزار توکن دارند.

جدول زیر ادعاهای منتشرشده‌ی هر دو شرکت را کنار هم می‌گذارد. یک هشدار لازم دارد: تمام این اعداد را خود سازنده‌ها گزارش کرده‌اند و آزمون مستقلی پشتشان نیست، مگر جایی که خلافش ذکر شده.

آزمون

GPT-6 Astra

Claude Fable 5.1

جلوتر

FrontierMath Tier 4 (ریاضی سطح مرزی)

97.6%

87.8%

Astra

Terminal-Bench Science 0.1

64.6%

52.6%

Astra

Terminal-Bench 4.0

57.9%

55.8%

Astra

AutomationBench (گردش‌کار اداری)

41.4%

31.4%

Astra

GPQA Diamond (علوم سطح تحصیلات تکمیلی)

96.0%

93.7%

Astra

DeepSWE v1.1 (مهندسی نرم‌افزار)

74.1%

67.4%

Astra

ExploitBench (ساخت اکسپلویت)

100%

70%

Astra

SRE-Bench (مهندسی معکوس باینری)

88.0%

12.5%

Astra

Humanity’s Last Exam (با ابزار)

57.2%

65.0%

Fable 5.1

Artificial Analysis Intelligence Index v4.1.1

61.2٪

65.7٪

Fable 5.1

Artificial Analysis Coding Agent Index v1.4

67.0٪

67.2٪

Fable 5.1

اعداد ستون Astra و ستون Fable 5.1 هر دو از صفحه‌ی رسمی GPT-6 Astra برداشته شده‌اند، یعنی از منبع رقیب. در دو مورد (ScreenSpot-Pro و ExploitGym) خود OpenAI در پانویس نوشته که نمره‌ی Claude را از Mythos گرفته، نه Fable؛ Mythos همان مدل با محافظ‌های کمتر است که در دسترس عموم نیست.

سه ردیف آخر جدول به‌اندازه‌ی هشت ردیف اول اهمیت دارند، چون نشان می‌دهند تصویر یک‌طرفه نیست.

یعنی در سنجه‌های ترکیبی یک ارزیاب مستقل، Fable 5.1 هنوز بالاتر از Astra نشسته، و در آزمون Humanity’s Last Exam با دسترسی به ابزار، فاصله‌اش تقریباً ۸ واحد درصد است. تناقض این دو تصویر معنای ساده‌ای دارد: Astra در کارهای عاملانه‌ی طولانی و در کار با کامپیوتر واقعاً جلو زده، ولی در «هوش عمومی» به معنای پاسخ به سؤال‌های سخت، هنوز برتری قاطعی ندارد.

Claude Fable 5.1 و Mythos 5.1 در اول سپتامبر ۲۰۲۶ منتشر شدند، دو روز پیش از Astra

دستورالعمل سیستمیک تفاوت اقتصادی هم هست که در جدول بنچمارک دیده نمی‌شود. قیمت پایه‌ی هر دو مدل در API یکسان است: ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی. اما Anthropic در Fable 5.1 هزینه‌ی خواندن از کش را ۷۵ درصد کم کرد، از یک دلار به ۲۵ سنت برای هر میلیون توکن. «کش» یعنی همان بخشی از ورودی که در طول یک جلسه‌ی طولانی بارها تکرار می‌شود، مثل یا کد پروژه. پس اگر ایجنتی دارید که ساعت‌ها روی یک مخزن کد کار می‌کند و مدام همان زمینه را دوباره می‌خواند، صورتحساب شما به‌شکل محسوسی پایین می‌آید؛ برآورد خود Anthropic حدود ۲۵ درصد صرفه‌جویی برای بارهای کاری معمول و تا ۴۵ درصد برای کارهای شدیداً عاملانه است. در مقابل، OpenAI برای Astra حالت Fast را معرفی کرده که تا دو برابر سریع‌تر است و دقیقاً دو برابر هم هزینه دارد.

امنیت سایبری: جایی که هوش مصنوعی Astra واقعاً از بقیه جدا می‌شود

این بخش دلیل اصلی تأخیر انتشار Astra است. OpenAI مدل را بدون محافظ‌های نسخه‌ی محصولی روی دو آزمون اجرا کرد که می‌سنجند آیا مدل می‌تواند یک آسیب‌پذیری شناخته‌شده‌ی نرم‌افزاری را به یک اکسپلویت کارا تبدیل کند یا نه. نتیجه: ۱۰۰ درصد در ExploitBench در برابر ۷۸.۵ درصد Sol، و ۴۲.۴ درصد در ExploitGym در برابر ۳۰.۳ درصد، آن هم با توکن خروجی به‌مراتب کمتر.

چون این احتمال وجود داشت که مدل صرفاً آسیب‌پذیری‌های قدیمیِ دیده‌شده در داده‌ی آموزش را بازتولید کند، OpenAI یک آزمون تازه هم ساخت: ۲۰ آسیب‌پذیری پرخطر در موتور V8 در ۱۳ نسخه‌ی پایدار کروم، همه از بازه‌ی ژوئن تا اوت ۲۰۲۶. Astra در این مجموعه ۳۹ درصد گرفت در برابر ۱۱.۵ درصد Sol. مهم‌تر اینکه در جریان همین ارزیابی، مدل دو آسیب‌پذیری ناشناخته پیدا کرد و از آن‌ها استفاده کرد؛ OpenAI می‌گوید هر دو را به نگهدارنده‌های نرم‌افزار گزارش کرده. در آزمون SRE-Bench هم که مهندسی معکوس فایل باینری بدون دسترسی به کد منبع را می‌سنجد، ۸۸ درصد تسک‌ها را در تلاش اول و ۹۹.۲ درصد را ظرف چهار تلاش حل کرد.

معنی عملی‌اش این است: نسخه‌ای که امروز عرضه شده، برای بازبینی امن کد و وصله‌کردن آسیب‌پذیری قابل استفاده است، ولی از انجام کارهای پیشرفته‌تر مثل ساخت اکسپلویت اثبات مفهوم امتناع می‌کند. OpenAI می‌گوید از طریق برنامه‌ی Daybreak، طی هفته‌های آینده محافظ‌های سست‌تری برای گروه محدودی از مدافعان باز می‌کند تا کارهایی مثل تحلیل بدافزار و مهندسی تشخیص هم ممکن شود.

ما خیلی نزدیک به یک تغییر کامل در چشم‌انداز حملات سایبری هستیم.
سم آلتمن، در دفاع از انتشار مدلی با این سطح از ریسک

معماری تازه، و دعوایی که سر آن راه افتاد

یک روز پیش از انتشار، نشریه‌ی The Information گزارش داد که Astra از تکنیکی به اسم recurrent depth یا «ترنسفورمر حلقه‌ای» استفاده می‌کند. توضیح ساده‌اش این است: مدل به‌جای اینکه اطلاعات را یک‌بار از لایه‌های شبکه رد کند، بخشی از آن را چند بار در همان لایه‌ها می‌چرخاند تا محاسبه‌ی بیشتری روی هر توکن انجام دهد. سود این کار سرعت و هزینه است. هزینه‌اش این است که بخشی از فکر کردن مدل دیگر به زبان طبیعی نوشته نمی‌شود و در حالت‌های پنهان می‌ماند.

چرا این مهم است؟ چون یکی از معدود ابزارهای عملی امروز برای فهمیدن اینکه یک ایجنت دارد چه کار می‌کند، خواندن زنجیره‌ی فکر یا chain of thought آن است. اگر آن زنجیره خوانا نباشد، این ابزار کند می‌شود. رایان گرین‌بلت از Redwood Research و باک شلگریس، مدیرعامل همان مؤسسه، هر دو نگرانی مشابهی مطرح کردند: مسئله فقط تنظیم فعلی نیست، بلکه این است که حالا یک «درجه» وجود دارد که می‌شود بالاتر بردش. به گفته‌ی شلگریس، اگر OpenAI این تکنیک را جلوتر ببرد، امکانش را دارد که میزان بازگشت را به‌شدت زیاد کند و نظارت‌پذیری زنجیره‌ی فکر را کاملاً از بین ببرد.

یاکوب پاچوکی، دانشمند ارشد OpenAI، پاسخ داد که عمق گراف محاسباتی مدل‌های مرزی فعلی این شرکت، از جمله Astra، در بازه‌ی حداکثر دو برابری GPT-4 است و شرکت استفاده از این تکنیک را عمداً محدود کرده تا زنجیره‌ی فکر خوانا بماند. او در عین حال پذیرفت که پایش زنجیره‌ی فکر سخت‌تر خواهد شد، ولی گفت دلیلش لزوماً معماری نیست: مدل‌های تواناتر کارهای سخت‌تر را با توکن‌های زبانی کمتر و گاهی بدون هیچ توکن زبانی انجام می‌دهند.

خود OpenAI هم در صفحه‌ی رسمی این را تأیید کرده، و این صادقانه‌ترین بخش اعلامیه است: ارزیابی‌های داخلی نشان داده استدلال نوشتاری Astra نسبت به Sol سخت‌تر قابل پایش است، در آزمون‌هایی که صریحاً از مدل خواسته شده از پایش فرار کند. شرکت می‌گوید این افت را جدی می‌گیرد و بهبود نظارت‌پذیری یک اولویت پژوهشی است.

۸ آتیش۰ دیدگاه7 بازدید
ارسطو اعتمادی ملکی
۶۹۹ مقاله۴۶ دنبال‌کننده

کارشناس ارشد مهندسی مواد از دانشگاه تبریز. از ۱۳۹۰ در حوزه عکاسی و گرافیک‌ام؛ آنچه دلبستگی بود، حرفه شد. بیت گرف را ساختم، از دستش دادم و دوباره ( این‌بار استوارتر) از نو بنا کردم. مقصد روشن است: مرجعی جامع برای آموزش گرافیک، هوش مصنوعی و کد.

گفتگو و سوالات شما

۰

در این قسمت می‌توانید سوال یا نظر خود در مورد مقاله را مطرح کنید.

برای ثبت دیدگاه ابتدا وارد شوید

ورود به حساب

هنوز دیدگاهی ثبت نشده. اولین نفر باشید!

مقالات مرتبط

اگر این را دوست داشتید، ترتیب خواندن بعدی این است

این مقاله‌ها روی «GPT» و «Claude» هم‌پوشانی دارند، مجموع زمان مطالعه ۲۴ دقیقه

مشاهده همه
  1. GPT و ۲ برچسب دیگر

    پایان مشکل هوش مصنوعی: SubQ با ۱۰۰۰ برابر صرفه‌جویی، Claude و GPT را به چالش می کشد؟

    SubQ به‌عنوان اولین مدل sub-quadratic با توان پردازش ۱۲ میلیون توکن و هزینه بسیار پایین معرفی شده و ادعا می‌کند می‌تواند محدودیت‌های معماری ترنسفورمر را برطرف کند.

    مهدی فریدونی۱۹ اردیبهشت۵ دقیقه
  2. GPT و ۱ برچسب دیگر

    حذف محدودیت پیام‌های متنی ChatGPT برای کاربران رایگان؛ GPT-5.6 Luna در راه است

    کاربران رایگان ChatGPT به‌زودی بدون سقف با این سرویس چت می‌کنند. OpenAI محدودیت پیام‌های متنی را حذف و قابلیت Think و مدل GPT-5.6 Luna را برای کاربران Free فعال می‌کند.

    بیت هاب۱۷ مرداد۵ دقیقه
  3. Claude و ۱ برچسب دیگر

    کلود فیبل ۵.۱ منتشر شد: هرچه عوض شده، در یک نگاه

    آنتروپیک نسخه‌ی تازه‌ی قوی‌ترین مدلش را عرضه کرد. مهم‌ترین تغییرها فقط نمره‌ی بنچمارک نیست؛ قیمت پایین‌تر و محافظ‌های دقیق‌تر هم بخشی از خبر است.

    ارسطو اعتمادی ملکی۱۱ شهریور۱۰ دقیقه
  4. Claude و ۱ برچسب دیگر

    پایان جنگ AI؟! Colossus 1 به خدمت Anthropic درآمد؛ شوک بزرگ ۲۰۲۶

    SpaceXAI با امضای قراردادی تاریخی، دسترسی کامل Anthropic به ابررایانه Colossus 1 را فراهم کرد تا ظرفیت پردازشی Claude و سرویس‌های مرتبط به شکل چشمگیری افزایش یابد. این همکاری غیرمنتظره میان رقبای حوز…

    مهدی فریدونی۱۹ اردیبهشت۴ دقیقه
۰

دوره به سبد ثبت‌نام اضافه شد

رفتن به سبد