اوپن‌ای‌آی در بیانیه‌ای مطبوعاتی نسخه‌ی تازه‌ی ChatGPT Images را معرفی کرد؛ مدلی که با جزئیات شارپ‌تر، نورپردازی طبیعی‌تر، بافت‌های غنی‌تر و ویرایش دقیق‌تر، تلاش می‌کند روند ساخت تصویر را از یک فرایند آزمایشی به یک جریان کاری لذت‌بخش و دقیق نزدیک‌تر کند.

اوپن‌ای‌آی می‌گوید هر هفته بیش از ۳ میلیارد تصویر در ChatGPT Images و مدل‌های GPT-Image در API ساخته می‌شود و همین حجم استفاده، زمینه‌ی عرضه‌ی نسخه‌ی ۲٫۵ را شکل داد. اوپن‌ای‌آی می‌گوید تأخیر تولید تصویر در مقایسه با Images 2.0 تا ۵۰ درصد کاهش یافته و همین تغییر، سرعت ایده‌پردازی و اصلاح خروجی را بالاتر می‌برد.

پخش از رسانه

محور اصلی ارتقا، فقط کیفیت بصری نیست. مدل تازه در حفظ سوژه‌های موجود در عکس مرجع عملکرد بهتری دارد، دستورهای ویرایشی را در چند نوبت دقیق‌تر دنبال می‌کند و هنگام بازسازی تصویر، بهتر می‌تواند نور، بافت و ویژگی‌های متمایز چهره یا سوژه را حفظ کند. اوپن‌ای‌آی تأکید می‌کند که خروجی‌ها در سناریوهای مبتنی بر عکس مرجع، طبیعی‌تر و وفادارتر به منبع دیده می‌شوند.

برای تیم‌هایی که با API کار می‌کنند، همین وفاداری اهمیت عملی دارد. نسخه‌های اصلاح‌شده می‌توانند به منبع اصلی نزدیک‌تر بمانند؛ موضوعی که برای تولید محتوای برندمحور، طراحی رابط یا ساخت نسخه‌های متعدد از یک المان بصری نقش تعیین‌کننده پیدا می‌کند.

تخت خواب بزرگ با ملحفه‌های سفید در یک اتاق خواب ساده
تخت خواب بزرگ با ملحفه‌های سفید در یک اتاق خواب آرام

سمت راست: تصویر ورودی / سمت چپ: خروجی مدل هوش مصنوعی

به گفته‌ی اوپن‌ای‌آی، Images 2.5 در ویرایش‌های هدفمند هم بهتر عمل می‌کند. مدل می‌تواند فقط همان بخشی را تغییر دهد که کاربر خواسته و در عین حال، سایر جزئیات را ثابت نگه دارد؛ حتی وقتی سوژه‌ها پیچیده‌تر باشند یا پس‌زمینه لایه‌های بیشتری داشته باشد.

سگ کوچک با لباس و کلاه مخصوص بدلکار (Stuntman) با طرح ستاره
سگ کوچک پشمالوی سفید با قلاده و زنجیر در فضای باز

سمت راست: تصویر ورودی / سمت چپ: خروجی مدل هوش مصنوعی

اوپن‌ای‌آی هم‌زمان چند قابلیت جدید را در ChatGPT اضافه کرده است. Sketch ابزار تازه‌ای است که اجازه می‌دهد کاربر مستقیما در ChatGPT طرح اولیه بکشد و از همان رسم ساده به‌عنوان راهنمای تصویر نهایی استفاده کند. کاربر می‌تواند چیدمان یک اتاق، فرم یک لباس یا حتی یک طرح سریع و ساده را بکشد و سپس با اضافه کردن توضیح درباره‌ی سبک و جزئیات، تصویر نهایی را دقیق‌تر هدایت کند.

پخش از رسانه

برای شروع سریع‌تر هم نمونه‌های اولیه معرفی شده‌اند. قالب‌هایی مثل Poster و Merch به کاربر کمک می‌کنند به‌جای صفحه‌ی خالی، از یک چارچوب آماده آغاز کند و سپس اطلاعات، عناصر طراحی یا سبک مورد نظر را به آن اضافه کند.

قابلیت دیگری که اضافه شده، امکان گذاشتن دیدگاه مستقیم روی تصویر است؛ ابزاری برای ویرایش متمرکزتر. در کنار آن، کاربر می‌تواند پرامپت‌های استفاده‌شده را هم به اشتراک بگذارد تا دیگران همان ایده را با عکس‌ها و جزئیات خودشان بازآفرینی کنند.

دسترسی و دامنه‌ی انتشار

Images 2.5 برای همه‌ی کاربران ChatGPT و ChatGPT Work و Codex در دسکتاپ، موبایل و وب در دسترس قرار گرفته است. اوپن‌ای‌آی گفته این عرضه به‌صورت تدریجی و در همه‌ی سطوح اشتراک انجام می‌شود.

در بخش توسعه‌دهندگان، دو مدل تازه هم به API آمده‌اند. GPT-Image-2.5 Flare کیفیت، ویرایش و سرعت نسخه‌ی جدید را به API می‌آورد و به‌عنوان انتخاب پیش‌فرض برای بیشتر سناریوها معرفی شده است. اوپن‌ای‌آی می‌گوید این مدل نسبت به GPT-Image-2 با تاخیر ۵۰ درصد کمتر، تصویرهایی با کیفیت بالاتر تولید می‌کند.

کاربردهای پیشنهادی برای Flare گسترده است و از محتوای شبکه‌های اجتماعی تا تجربه‌های محصول، جست‌وجوی بصری، نمونه‌سازی سریع و تولید با حجم بالا را دربر می‌گیرد.

مدل دوم، GPT-Image-2.5 Sunburst، برای کارهای سطح‌بالاتر ساخته شده؛ جایی که کنترل دقیق‌تر بر ویرایش‌ها اهمیت دارد. اوپن‌ای‌آی این مدل را مناسب تولید کمپین‌های آماده‌ی انتشار و تصویرهای محصول معرفی می‌کند.

اوپن‌ای‌آی می‌گوید قوی‌ترین تصویرها معمولا به آدم‌ها، مکان‌ها و خاطره‌های واقعی نزدیک‌ترند. Images 2.5 در کار با عکس‌های مرجع، هنگام انتقال سوژه‌ها به محیط‌های تازه، سبک‌های بصری متفاوت یا ترکیب‌بندی‌های تازه، عملکرد منسجم‌تری نشان می‌دهد. در چنین خروجی‌هایی، چهره‌ها قابل‌تشخیص‌تر می‌مانند، نور و بافت طبیعی‌تر دیده می‌شود و ویژگی‌های شاخص سوژه بیشتر حفظ می‌شوند.

عرضه‌ی Images 2.5 و مدل‌های GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst نشان می‌دهد اوپن‌ای‌آی همچنان روی سه محور هم‌زمان حرکت می‌کند، کیفیت بالاتر، ویرایش قابل‌اعتمادتر و سرعت بیشتر. ترکیب این سه، همان جایی است که بازار تصویرسازی مولد امروز بیشترین رقابت را تجربه می‌کند.

شما کدام قابلیت جدید را مهم‌تر می‌دانید؟