هوش مصنوعی

مقایسه GPT Image 2.5 و GPT Image 2: مدل تصویرساز جدید OpenAI

GPT Image 2.5 جهش نسلی نیست؛ سریع‌تر است، دقیق‌تر ویرایش می‌کند و قیمت هر توکنش با GPT Image 2 یکی است. مقایسه‌ی دو مدل با تکیه بر مستندات OpenAI و تست‌های مستقل.

ارسطو اعتمادی ملکی
۲۱ شهریور ۱۴۰۵ · 9 دقیقه مطالعه
مقایسه GPT Image 2.5 و GPT Image 2: مدل تصویرساز جدید OpenAI

OpenAI روز ۸ سپتامبر ۲۰۲۶ (۱۷ شهریور ۱۴۰۵) مدل ChatGPT Images 2.5 را منتشر کرد؛ جانشین ChatGPT Images 2.0 که اردیبهشت همین سال آمده بود. خلاصه‌ی مقایسه‌ی GPT Image 2.5 و GPT Image 2 این است: GPT Image 2.5 جهش نسلی نیست. سریع‌تر است، ویرایش را دقیق‌تر انجام می‌دهد و آدم‌ها و محصولات داخل عکس مرجع را بهتر نگه می‌دارد. قیمت هر توکن هم عوض نشده. در ادامه، ادعاهای OpenAI را کنار تست‌های مستقل می‌گذاریم.

GPT Image 2 چه چیزی آورده بود

مدل gpt-image-2 روز ۲۱ آوریل ۲۰۲۶ عرضه شد و اولین مدل تصویری OpenAI بود که «فکرکردن» داشت؛ یعنی قبل از کشیدن، ترکیب‌بندی را برنامه‌ریزی می‌کند، در صورت نیاز در وب جستجو می‌کند و خروجی را پیش از تحویل چک می‌کند. نقطه‌ی قوت دیگرش نوشتن متن داخل تصویر بود، از جمله به زبان‌های غیرلاتین.

پیشرفت‌های GPT Image 2.5 نسبت به نسخه‌ی ۲

سرعت

OpenAI می‌گوید تأخیر (فاصله‌ی ارسال درخواست تا تحویل تصویر) تا ۵۰ درصد نسبت به Images 2.0 کم شده. تست مستقل Tosea این عدد را تأیید می‌کند: برای ساخت یک اسلاید یکسان با هزینه‌ی برابر، gpt-image-2 به‌طور میانگین ۳۷٫۳ ثانیه، Sunburst ۲۷٫۷ ثانیه و Flare ۱۹٫۷ ثانیه وقت گرفت. یعنی Flare حدود ۴۷ درصد سریع‌تر بود. برای کسی که روزی ده‌ها تصویر می‌سازد، این یعنی نصف زمان انتظار با همان هزینه.

ویرایش دقیق و چندمرحله‌ای

اصلی‌ترین ادعای OpenAI این است که مدل جدید فقط همان بخشی را که خواسته‌اید تغییر می‌دهد و در ویرایش چندمرحله‌ای (چند اصلاح پشت‌سرهم در یک گفتگو) هم تغییرهای قبلی و کیفیت تصویر حفظ می‌شوند.

تست Tosea نشان می‌دهد این بهبود واقعی اما محدود است. هر سه مدل هر سه ویرایش را درست انجام دادند؛ تفاوت در جابه‌جاشدن بقیه‌ی تصویر بود: بعد از سه مرحله، ۱۱٫۴ درصد پیکسل‌ها در gpt-image-2 تغییر کرده بود، در Sunburst ۹٫۹ و در Flare ۹٫۲ درصد. پس اگر بخشی از تصویر باید دست‌نخورده بماند، هنوز به ماسک نیاز دارید (تصویری که مشخص می‌کند فقط کدام ناحیه ویرایش شود). البته طبق مستندات OpenAI، مدل مرز ماسک را هم کاملاً دقیق رعایت نمی‌کند.

GPT-Image 2.5 در برابر GPT-Image 2.0: انیمیشن استاپ‌موشن از پوسیدن یک سیب 🍎 ۸ فریم جداگانه ساخته و بعد به یک GIF تبدیل شده‌اند. GPT-Image 2.5 خودِ سیب را در طول ویرایش‌های پشت‌سرهم خیلی بهتر دست‌نخورده نگه می‌دارد.

نور، بافت و ابزارهای تازه

به گفته‌ی OpenAI، نسخه‌ی 2.5 نور طبیعی‌تر و بافت غنی‌تری می‌سازد، سوژه‌های عکس مرجع را قابل‌تشخیص‌تر نگه می‌دارد و پس‌زمینه‌ی شفاف را بهتر اجرا می‌کند. در ChatGPT هم ابزار Sketch (با تایپ @Sketch طرح اولیه را خودتان می‌کشید)، قالب‌های آماده و کامنت‌گذاشتن روی یک نقطه از تصویر برای ویرایش همان‌جا اضافه شده.

Flare و Sunburst: دو مدل با یک قیمت

در API (رابطی که توسعه‌دهنده‌ها با آن مدل را داخل محصول خودشان به کار می‌برند)، مدل تصویرساز جدید OpenAI این بار در قالب دو مدل عرضه شده. Flare پیش‌فرض است و به گفته‌ی OpenAI کیفیتی بالاتر از gpt-image-2 با نصف تأخیر دارد. Sunburst برای کارهایی مثل تصویر نهایی کمپین ساخته شده که کنترل دقیق‌تری روی ویرایش لازم دارند؛ در عوض کندتر است.

قیمت هر توکن (واحدی که OpenAI هزینه را با آن حساب می‌کند) در هر دو مدل با gpt-image-2 یکی است: برای هر میلیون توکن، ۵ دلار متن ورودی، ۸ دلار تصویر ورودی و ۳۰ دلار تصویر خروجی. درباره‌ی هزینه‌ی واقعی هر تصویر اما منابع هم‌نظر نیستند: The Decoder دیده Sunburst معمولاً گران‌تر از Flare تمام می‌شود، ولی Tosea برای هر دو مدل توکن یکسان ثبت کرده.

در جدول Arena (سایتی که کاربران خروجی مدل‌ها را بدون دانستن نامشان مقایسه می‌کنند)، هر دو مدل جدید بالاتر از gpt-image-2 نشسته‌اند؛ اما امتیازشان مقدماتی است و فقط حدود ۳ هزار رأی پشتش است.

نمودار امتیاز Arena برای gpt-image-2، Flare و Sunburst

جدول مقایسه‌ی سه مدل:

ویژگی

gpt-image-2

gpt-image-2.5-flare

gpt-image-2.5-sunburst

تاریخ عرضه

۲۱ آوریل ۲۰۲۶

۸ سپتامبر ۲۰۲۶

۸ سپتامبر ۲۰۲۶

نقش

مدل واحد

پیش‌فرض و سریع

دقت بیشتر در ویرایش

سطوح کیفیت

low، medium، high

low تا max (پنج سطح)

low تا max (پنج سطح)

زمان اسلاید در تست Tosea

۳۷٫۳ ثانیه

۱۹٫۷ ثانیه

۲۷٫۷ ثانیه

امتیاز Arena

۱۳۸۱

۱۳۹۹

۱۴۲۱

قیمت تصویر خروجی

۳۰ دلار در میلیون توکن

۳۰ دلار در میلیون توکن

۳۰ دلار در میلیون توکن

تغییری که هزینه را جابه‌جا می‌کند

نسخه‌ی 2.5 دو سطح کیفیت xhigh و max اضافه کرده، اما به گفته‌ی Tosea معنای نام‌های قدیمی هم عوض شده: high در 2.5 همان‌قدر توکن خرج می‌کند که medium در نسخه‌ی ۲، و max برابر high قدیمی است. طبق محاسبه‌ی Apidog، یک تصویر ۱۰۲۴×۱۰۲۴ در سطح high حدود ۰٫۰۵۳ دلار و در سطح max حدود ۰٫۲۱ دلار هزینه دارد؛ همان قیمت high در gpt-image-2.

پس اگر فقط نام مدل را در کد عوض کنید و quality را روی medium نگه دارید، مدل جدید حدود ۳٫۸ برابر توکن کمتری خرج می‌کند. هزینه پایین می‌آید، ولی ترکیب‌بندی ساده‌تر می‌شود. برای کیفیت برابر، medium را به high و high را به max ببرید.

نمودار جابه‌جایی سطوح کیفیت بین gpt-image-2 و GPT Image 2.5

محدودیت‌ها و سؤال‌های باز

هنوز مشخص نیست مدل تصویرساز جدید OpenAI در ChatGPT کی از Flare و کی از Sunburst استفاده می‌کند؛ OpenAI در این باره چیزی نگفته. در تست The Decoder، حالت Work فقط همان چیزی را که خواسته شده بود تغییر داد، اما Chat عادی در ویرایش‌های بعدی جزئیات دیگری را هم عوض کرد. Tosea جهشی در نوشتن متن داخل تصویر ندید، چون نسخه‌ی ۲ از قبل در این کار خطای کمی داشت. MindStudio هم گزارش داده که حالت «چسبانده‌شده» سوژه روی پس‌زمینه و نویز تصویر کمتر شده، اما کامل از بین نرفته. تخفیف Batch (پردازش گروهی ارزان‌تر) هم فعلاً فقط برای gpt-image-2 وجود دارد.

کدام را انتخاب کنیم

کاربر ChatGPT لازم نیست کاری بکند؛ Images 2.5 برای همه‌ی پلن‌ها، حتی نسخه‌ی رایگان، فعال شده است. در API، مدل Flare را پیش‌فرض بگذارید، چون سریع‌تر است و قیمت هر توکنش با Sunburst فرقی ندارد. Sunburst را برای تصویرهای نهایی نگه دارید که چند دور ویرایش می‌شوند و سوژه باید ثابت بماند. سطح quality را هم صریح تعیین کنید تا کیفیت یا هزینه بی‌صدا تغییر نکند. به گفته‌ی Tosea، شرکت OpenAI هنوز تاریخی برای کنارگذاشتن gpt-image-2 اعلام نکرده، پس می‌توانید آن را به‌عنوان جایگزین نگه دارید. کاور این مقاله با GPT image 2.5 Flare طراحی شده است. نظر شما چیه؟

۰ آتیش۰ دیدگاه34 بازدید
ارسطو اعتمادی ملکی
۷۰۱ مقاله۴۹ دنبال‌کننده

کارشناس ارشد مهندسی مواد از دانشگاه تبریز. از ۱۳۹۰ در حوزه عکاسی و گرافیک‌ام؛ آنچه دلبستگی بود، حرفه شد. بیت گرف را ساختم، از دستش دادم و دوباره ( این‌بار استوارتر) از نو بنا کردم. مقصد روشن است: مرجعی جامع برای آموزش گرافیک، هوش مصنوعی و کد.

banner-web-1000---150

گفتگو و سوالات شما

۰

در این قسمت می‌توانید سوال یا نظر خود در مورد مقاله را مطرح کنید.

برای ثبت دیدگاه ابتدا وارد شوید

ورود به حساب

هنوز دیدگاهی ثبت نشده. اولین نفر باشید!

مقالات مرتبط

اگر این را دوست داشتید، ترتیب خواندن بعدی این است

این مقاله‌ها روی «GPT» هم‌پوشانی دارند، مجموع زمان مطالعه ۳۴ دقیقه

مشاهده همه
  1. GPT و ۲ برچسب دیگر

    معرفی Qwen 3.6؛ خانواده‌ای از مدل‌های هوش مصنوعی که Claude و GPT را به چالش کشید

    علی‌بابا با انتشار خانواده‌ی Qwen 3.6 وارد رقابت جدی با Claude و GPT شده است. این مقاله سه نسخه‌ی Max، Plus و 35B-A3B را معرفی می‌کند، بنچمارک‌های کلیدی را بررسی می‌کند. نسخه‌ی متن‌باز در انتهای مقال…

    ارسطو اعتمادی ملکی۱ اردیبهشت۱۶ دقیقه
  2. GPT و ۲ برچسب دیگر

    هوش مصنوعی‌های داخلی در زمان قطع اینترنت: راهکارهای موقت و کاربردی

    در نبود یا قطعی اینترنت، نگران دسترسی به هوش مصنوعی خواهیم بود! راهکارهای جایگزین اگرچه سرعتشون کمتره، اما برای کارهای ساده می توانند موثر باشند.

    ارسطو اعتمادی ملکی۲۶ دی۶ دقیقه
  3. GPT و ۲ برچسب دیگر

    مقایسه Midjourney 7 و ChatGPT

    در این آموزش به مقایسه دقیق و عملی بین Midjourney 7 و ChatGPT در تولید تصاویر هوش مصنوعی می‌پردازیم. با بررسی خروجی‌ها در سبک‌های مختلف، به شما کمک می‌کنیم بهترین ابزار را برای پروژه‌های تصویری‌تان ا…

    ارسطو اعتمادی ملکی۲۶ اردیبهشت۵ دقیقه
  4. GPT و ۲ برچسب دیگر

    آنچه در ۲ هفته قطعی اینترنت در دنیای AI گذشت!

    آیا در این ۱۴ روز قطعی از قطار هوش مصنوعی جا ماندیم؟ گزارش جامع تحلیلی و راهنمای بازگشت به اکوسیستم هوش مصنوعی. آخرین آپدیت های مصنوعی در ژانویه ۲۰۲۶ (دی و بهمن ۱۴۰۴) را در این مقاله بخوانید.

    ارسطو اعتمادی ملکی۳ بهمن۷ دقیقه
۰

دوره به سبد ثبت‌نام اضافه شد

رفتن به سبد