GPT-6 Astra منتشر شد: هرچه OpenAI اعلام کرد، و هرچه اعلام نکرد
مدل جدید OpenAI یعنی GPT-6 Astra منتشر شد. بنچمارکهای واقعی، مقایسه با Claude Fable 5.1، قیمت، و جاهایی که ادعاها مشکوک است.

OpenAI مدل پرچمدار تازهاش را داد بیرون، رئیس شرکت در جلسه خبری گفت «به عصر AGI خوش آمدید»، و دو روز قبلش Anthropic هم Claude Fable 5.1 را منتشر کرده بود. اینجا اعداد هر دو را کنار هم میگذاریم، از جمله اعدادی که Astra در آنها عقب است.
OpenAI روز پنجشنبه ۳ سپتامبر ۲۰۲۶ مدل GPT-6 Astra را منتشر کرد. Astra جانشین GPT-5.6 Sol است و اولین مدلی است که این شرکت آن را در چارچوب آمادگی خودش (Preparedness Framework) در سطح «بحرانی» یا Critical برای توانایی سایبری طبقهبندی کرده. انتشار اولیه محدود بود: فقط تعداد کمی سازمان، و مشتریان برنامه امنیتی Daybreak. دسترسی کاربران ChatGPT Plus، Pro، Business و Enterprise قرار است طی روزهای بعد باز شود. طبق گزارش کاربران این دسترسی در حال ایجاد است.
سم آلتمن در X نوشت که Astra به باور آنها بهترین مدل دنیا برای کار با کامپیوتر، کار حرفهای، علم، کدنویسی و امنیت سایبری است، و اینکه انتشارش «کمی بیشتر طول کشید» تا استانداردهای ایمنی این سطح از توانایی برآورده شود. گرگ براکمن، رئیس OpenAI، در جلسه خبری جملهای گفت که تیتر خیلی از خبرها شد: «به عصر AGI خوش آمدید.» خودش بعداً روشن کرد که این یک اعلام رسمی نیست؛ فقط میگوید بعید نیست که ما همین الان داخل آن دوره باشیم. تعریف رسمی خود OpenAI از AGI سیستمی است که در بیشتر مدل جدید OpenAI Astraکارهای دارای ارزش اقتصادی از انسان بهتر عمل کند، و شرکت هیچ شواهدی منتشر نکرده که Astra از این خط رد شده باشد.منظور از AGI (Artificial General Intelligence)، هوش مصنوعیای است که بتواند در طیف بسیار گستردهای از کارهای فکری، مثل یک انسان توانمند، یاد بگیرد، استدلال کند، مسئله حل کند و خودش را با مسائل جدید تطبیق دهد؛ نه اینکه فقط برای یک کار مشخص ساخته شده باشد.
اسم Astra از کجا آمد
Astra یکشبه ظاهر نشد. OpenAI اسمش را اول اوت ۲۰۲۶ و آن هم داخل یک پست پژوهشی درباره ریاضیات تأیید کرد، نه در یک رویداد معرفی محصول. در آن گزارش گفت نسخهای داخلی از Astra ده مسئله باز ریاضی و علوم کامپیوتر نظری را حل کرده؛ مسئلههایی که دستکم یک دهه، و در بیشتر موارد خیلی بیشتر، کسی رویشان پیشرفتی نکرده بود.
در روز انتشار، OpenAI دو نتیجه تازه دیگر هم درباره فاصله اعداد اول اضافه کرد. یکی از آنها کران شناختهشده برای فاصله جفتهای اعداد اول را از ۲۴۰ به ۱۸۶ رساند، و دیگری یک جمله در کران فاصلههای بزرگ بین اعداد اول را بهبود داد که بیش از ۸۰ سال دستنخورده مانده بود.
Astra عملاً چه کار میکند
هدف اصلی این نسخه «کار با کامپیوتر» است، یعنی همان چیزی که به آن computer use میگویند: مدل بهجای اینکه فقط متن جواب بدهد، خودش صفحه را میبیند، کلیک میکند، فرم پر میکند و بین نرمافزارها جابهجا میشود. OpenAI مثالهایش را کاملاً روزمره انتخاب کرده: پر کردن فرمهای آنلاین، بهروز کردن رکورد مشتری در CRM، مرتب کردن تقویم، جستوجوی اینترنتی و نوشتن خلاصهاش داخل ایمیل یا ویرایشگر متن، و تست کردن ظاهر یک سایت بعد از ساختنش.
عدد این بخش قابل لمستر از بقیه است. در شبیهسازی تأخیر روی بنچمارک OSWorld 2.0، مدل نمره ۷۲.۶ درصد را در حدود ۴۰ دقیقه برای هر تسک گرفته، در برابر ۶۵.۷ درصد در حدود ۷۵ دقیقه برای Sol. یعنی هم نمره بالاتر، هم حدود ۴۷ درصد زمان کمتر. OpenAI همزمان هارنس Codex را هم بهروز کرد و میگوید ترکیب این دو، روی بنچمارک Mind2Web، کارها را ۱.۹ برابر سریعتر از تجربه فعلی Sol تمام میکند. برای کاربر معمولی معنیاش این است که کاری مثل گشتن دنبال آپارتمان که بهطور معمول حدود شش ساعت وقت میبرد، طبق مثال خود شرکت میتواند زیر ده دقیقه تمام شود؛ البته این یک نمونهی انتخابی از سوی سازنده است، نه میانگین یک آزمون مستقل.
بخش دوم، کار حرفهای است. Astra برای تولید خروجیهای قابل تحویل آموزش دیده: اسلاید، سند، صفحهگسترده و تحلیل، آن هم با پیروی از قالب و لحن خود شما. در نمایش شرکت، مدل با گرفتن فقط چند اسلاید از قالب ارائه OpenAI، یک ارائه کامل ساخته که لحن و چیدمانش با بقیه هماهنگ بوده. نکتهی کاربردیاش این است که خروجی معمولاً لازم نیست دوباره از اول قالببندی شود.
سومین تغییر مهم مخصوص برنامهنویسهاست. تا امروز وقتی پنجرهی زمینهی یک مدل پر میشد، ابزارها از compaction استفاده میکردند، یعنی کل گفتوگوی قبلی را در یک خلاصه فشرده میکردند. مشکل این روش این است که هر بار فشردهسازی، جزئیاتی مثل «چرا آن راهحل قبلی جواب نداد» را دور میریزد. در Codex، مدل حالا میتواند بین پنجرههای زمینه یادداشت نگه دارد و پنجرههای قبلی هم قابل جستوجو میمانند. پس اگر ساعتها روی یک باگ کار کردهاید، مدل بهجای فراموش کردن مسیر شکستخورده، میتواند برگردد و همان را پیدا کند. این قابلیت فعلاً آزمایشی است و باید در فایل config.toml روشنش کنید.
عددها، و جایی که باید احتیاط کرد
OpenAI سه عدد را جلوی همه گذاشت: ۹۷.۶ درصد در FrontierMath Tier 4 و ۹۹.۹ درصد در ARC-AGI-3 و ۱۰۰ درصد در ExploitBench. عدد دوم همان جایی است که باید مکث کرد.

نمره ۹۹.۹ درصدی ARC-AGI-3 با هارنسی به نام Provider Adapter گرفته شده که استدلال مدل را بین نوبتها زنده نگه میدارد. «هارنس» یعنی همان لایهی نرمافزاری دور مدل که ابزارها، حافظه و شیوهی اجرای آزمون را تعیین میکند. با هارنس استاندارد خود بنچمارک، Astra نمره ۶۲.۷ درصد گرفته. هر دو عدد درستاند، ولی یک چیز را نمیگویند: بخش بزرگی از این جهش، بهجای خود مدل، از زیرساخت اطرافش میآید. پس اگر با API خام کار میکنید و همان هارنس را ندارید، انتظار عدد ۹۹.۹ را نداشته باشید.

فاصلهی Astra با Fable 5.1 در این آزمون ۲.۱ واحد درصد است، یعنی نزدیک. جایی که فاصله واقعاً باز میشود، کارهای پژوهشی است.

مقایسه GPT 6 Astra با Claude Fable 5.1
Anthropic دو روز قبل از OpenAI، در اول سپتامبر، مدلهای Claude Fable 5.1 و Claude Mythos 5.1 را منتشر کرد. این دو در واقع یک مدلاند با دو سطح متفاوت از محافظها: Fable 5.1 برای همه در دسترس است، و Mythos 5.1 فقط برای افراد و سازمانهای تأییدشدهی آمریکایی در برنامههای دسترسی مورد اعتماد، آن هم برای کار امنیت سایبری دفاعی و علوم زیستی. هر دو پنجرهی زمینهی یک میلیون توکنی و سقف خروجی ۱۲۸ هزار توکن دارند.
جدول زیر ادعاهای منتشرشدهی هر دو شرکت را کنار هم میگذارد. یک هشدار لازم دارد: تمام این اعداد را خود سازندهها گزارش کردهاند و آزمون مستقلی پشتشان نیست، مگر جایی که خلافش ذکر شده.
آزمون | GPT-6 Astra | Claude Fable 5.1 | جلوتر |
|---|---|---|---|
FrontierMath Tier 4 (ریاضی سطح مرزی) | 97.6% | 87.8% | Astra |
Terminal-Bench Science 0.1 | 64.6% | 52.6% | Astra |
Terminal-Bench 4.0 | 57.9% | 55.8% | Astra |
AutomationBench (گردشکار اداری) | 41.4% | 31.4% | Astra |
GPQA Diamond (علوم سطح تحصیلات تکمیلی) | 96.0% | 93.7% | Astra |
DeepSWE v1.1 (مهندسی نرمافزار) | 74.1% | 67.4% | Astra |
ExploitBench (ساخت اکسپلویت) | 100% | 70% | Astra |
SRE-Bench (مهندسی معکوس باینری) | 88.0% | 12.5% | Astra |
Humanity’s Last Exam (با ابزار) | 57.2% | 65.0% | Fable 5.1 |
Artificial Analysis Intelligence Index v4.1.1 | 61.2٪ | 65.7٪ | Fable 5.1 |
Artificial Analysis Coding Agent Index v1.4 | 67.0٪ | 67.2٪ | Fable 5.1 |
اعداد ستون Astra و ستون Fable 5.1 هر دو از صفحهی رسمی GPT-6 Astra برداشته شدهاند، یعنی از منبع رقیب. در دو مورد (ScreenSpot-Pro و ExploitGym) خود OpenAI در پانویس نوشته که نمرهی Claude را از Mythos گرفته، نه Fable؛ Mythos همان مدل با محافظهای کمتر است که در دسترس عموم نیست.
سه ردیف آخر جدول بهاندازهی هشت ردیف اول اهمیت دارند، چون نشان میدهند تصویر یکطرفه نیست.

یعنی در سنجههای ترکیبی یک ارزیاب مستقل، Fable 5.1 هنوز بالاتر از Astra نشسته، و در آزمون Humanity’s Last Exam با دسترسی به ابزار، فاصلهاش تقریباً ۸ واحد درصد است. تناقض این دو تصویر معنای سادهای دارد: Astra در کارهای عاملانهی طولانی و در کار با کامپیوتر واقعاً جلو زده، ولی در «هوش عمومی» به معنای پاسخ به سؤالهای سخت، هنوز برتری قاطعی ندارد.
Claude Fable 5.1 و Mythos 5.1 در اول سپتامبر ۲۰۲۶ منتشر شدند، دو روز پیش از Astra
دستورالعمل سیستمیک تفاوت اقتصادی هم هست که در جدول بنچمارک دیده نمیشود. قیمت پایهی هر دو مدل در API یکسان است: ۱۰ دلار برای هر میلیون توکن ورودی و ۵۰ دلار برای هر میلیون توکن خروجی. اما Anthropic در Fable 5.1 هزینهی خواندن از کش را ۷۵ درصد کم کرد، از یک دلار به ۲۵ سنت برای هر میلیون توکن. «کش» یعنی همان بخشی از ورودی که در طول یک جلسهی طولانی بارها تکرار میشود، مثل یا کد پروژه. پس اگر ایجنتی دارید که ساعتها روی یک مخزن کد کار میکند و مدام همان زمینه را دوباره میخواند، صورتحساب شما بهشکل محسوسی پایین میآید؛ برآورد خود Anthropic حدود ۲۵ درصد صرفهجویی برای بارهای کاری معمول و تا ۴۵ درصد برای کارهای شدیداً عاملانه است. در مقابل، OpenAI برای Astra حالت Fast را معرفی کرده که تا دو برابر سریعتر است و دقیقاً دو برابر هم هزینه دارد.

امنیت سایبری: جایی که هوش مصنوعی Astra واقعاً از بقیه جدا میشود
این بخش دلیل اصلی تأخیر انتشار Astra است. OpenAI مدل را بدون محافظهای نسخهی محصولی روی دو آزمون اجرا کرد که میسنجند آیا مدل میتواند یک آسیبپذیری شناختهشدهی نرمافزاری را به یک اکسپلویت کارا تبدیل کند یا نه. نتیجه: ۱۰۰ درصد در ExploitBench در برابر ۷۸.۵ درصد Sol، و ۴۲.۴ درصد در ExploitGym در برابر ۳۰.۳ درصد، آن هم با توکن خروجی بهمراتب کمتر.
چون این احتمال وجود داشت که مدل صرفاً آسیبپذیریهای قدیمیِ دیدهشده در دادهی آموزش را بازتولید کند، OpenAI یک آزمون تازه هم ساخت: ۲۰ آسیبپذیری پرخطر در موتور V8 در ۱۳ نسخهی پایدار کروم، همه از بازهی ژوئن تا اوت ۲۰۲۶. Astra در این مجموعه ۳۹ درصد گرفت در برابر ۱۱.۵ درصد Sol. مهمتر اینکه در جریان همین ارزیابی، مدل دو آسیبپذیری ناشناخته پیدا کرد و از آنها استفاده کرد؛ OpenAI میگوید هر دو را به نگهدارندههای نرمافزار گزارش کرده. در آزمون SRE-Bench هم که مهندسی معکوس فایل باینری بدون دسترسی به کد منبع را میسنجد، ۸۸ درصد تسکها را در تلاش اول و ۹۹.۲ درصد را ظرف چهار تلاش حل کرد.
معنی عملیاش این است: نسخهای که امروز عرضه شده، برای بازبینی امن کد و وصلهکردن آسیبپذیری قابل استفاده است، ولی از انجام کارهای پیشرفتهتر مثل ساخت اکسپلویت اثبات مفهوم امتناع میکند. OpenAI میگوید از طریق برنامهی Daybreak، طی هفتههای آینده محافظهای سستتری برای گروه محدودی از مدافعان باز میکند تا کارهایی مثل تحلیل بدافزار و مهندسی تشخیص هم ممکن شود.
ما خیلی نزدیک به یک تغییر کامل در چشمانداز حملات سایبری هستیم.
معماری تازه، و دعوایی که سر آن راه افتاد
یک روز پیش از انتشار، نشریهی The Information گزارش داد که Astra از تکنیکی به اسم recurrent depth یا «ترنسفورمر حلقهای» استفاده میکند. توضیح سادهاش این است: مدل بهجای اینکه اطلاعات را یکبار از لایههای شبکه رد کند، بخشی از آن را چند بار در همان لایهها میچرخاند تا محاسبهی بیشتری روی هر توکن انجام دهد. سود این کار سرعت و هزینه است. هزینهاش این است که بخشی از فکر کردن مدل دیگر به زبان طبیعی نوشته نمیشود و در حالتهای پنهان میماند.
چرا این مهم است؟ چون یکی از معدود ابزارهای عملی امروز برای فهمیدن اینکه یک ایجنت دارد چه کار میکند، خواندن زنجیرهی فکر یا chain of thought آن است. اگر آن زنجیره خوانا نباشد، این ابزار کند میشود. رایان گرینبلت از Redwood Research و باک شلگریس، مدیرعامل همان مؤسسه، هر دو نگرانی مشابهی مطرح کردند: مسئله فقط تنظیم فعلی نیست، بلکه این است که حالا یک «درجه» وجود دارد که میشود بالاتر بردش. به گفتهی شلگریس، اگر OpenAI این تکنیک را جلوتر ببرد، امکانش را دارد که میزان بازگشت را بهشدت زیاد کند و نظارتپذیری زنجیرهی فکر را کاملاً از بین ببرد.
یاکوب پاچوکی، دانشمند ارشد OpenAI، پاسخ داد که عمق گراف محاسباتی مدلهای مرزی فعلی این شرکت، از جمله Astra، در بازهی حداکثر دو برابری GPT-4 است و شرکت استفاده از این تکنیک را عمداً محدود کرده تا زنجیرهی فکر خوانا بماند. او در عین حال پذیرفت که پایش زنجیرهی فکر سختتر خواهد شد، ولی گفت دلیلش لزوماً معماری نیست: مدلهای تواناتر کارهای سختتر را با توکنهای زبانی کمتر و گاهی بدون هیچ توکن زبانی انجام میدهند.
خود OpenAI هم در صفحهی رسمی این را تأیید کرده، و این صادقانهترین بخش اعلامیه است: ارزیابیهای داخلی نشان داده استدلال نوشتاری Astra نسبت به Sol سختتر قابل پایش است، در آزمونهایی که صریحاً از مدل خواسته شده از پایش فرار کند. شرکت میگوید این افت را جدی میگیرد و بهبود نظارتپذیری یک اولویت پژوهشی است.





گفتگو و سوالات شما
۰در این قسمت میتوانید سوال یا نظر خود در مورد مقاله را مطرح کنید.
برای ثبت دیدگاه ابتدا وارد شوید
ورود به حسابهنوز دیدگاهی ثبت نشده. اولین نفر باشید!