گوگل با معرفی Gemini Omni 1.1 Flash مجموعه‌ای از ابزارهای خلاقانه و قابلیت‌ تولید ویدئو را پیش روی توسعه‌دهندگان گذاشت؛ مجموعه‌ای که هدفش ساده‌تر کردن ساخت ابزارها، ویرایش محتوای چند رسانه‌ای و جریان‌های کاری ویدئویی است.

بر اساس بیانیه‌ی مطبوعاتی گوگل، نسخه‌ی تازه‌ی Omni با اتکا به Gemini API در Google AI Studio به مرحله‌ی آماده‌سازی برای استفاده‌ی حرفه‌ای رسیده و قرار است تولید ویدئو را قابل‌کنترل‌تر، سریع‌تر و مناسب‌تر برای استقرار در محیط واقعی کند.

یکی از مهم‌ترین ویژگی‌های جدید، Scene Extension یا ادامه‌دادن صحنه است. توسعه‌دهنده می‌تواند یک ویدئوی موجود را بگیرد و از همان نقطه، تولید را ادامه دهد؛ بدون آن‌که پیوستگی تصویر از بین برود.

پخش از رسانه

در Omni 1.1، مدل می‌تواند تا ۱۰ ثانیه زمینه‌ی قبلی را تحلیل کند؛ جهشی محسوس نسبت به مدل‌های قبلی که فقط به آخرین ثانیه تکیه می‌کردند. نتیجه، ثبات بصری بهتر و وفاداری بیشتر به روایت است. تولید در گام‌های ۱۰ ثانیه‌ای انجام می‌شود و طول تجمعی ویدئو می‌تواند تا ۴۰ ثانیه برسد.

گوگل برای این قابلیت نمونه‌ای هم ارائه کرده که در آن توسعه‌دهنده با همان شناسه‌ی تعامل قبلی، درخواست ادامه‌ی صحنه را به مدل می‌فرستد. در چنین سناریویی، تمرکز روی امتداد طبیعی داستان است، نه ساختن یک برش تازه از صفر.

کنترل آغاز و پایان نما

قابلیت بعدی، تعیین فریم آغاز و پایان هر نما است. Omni 1.1 می‌تواند بین دو فریم کلیدی، ویدئویی پیوسته بسازد؛ موضوعی که برای حرکت‌های پیچیده‌ی دوربین، چرخش‌های نمایشی و زوم‌های نرم کاربرد دارد.

نمونه‌های مطرح‌شده در توضیحات گوگل، از نماهای نزدیک و حرکت سریع دوربین تا صحنه‌های موسیقایی و رقص را دربر می‌گیرند. پیام اصلی روشن است: مدل تازه قرار نیست فقط یک کلیپ بسازد، بلکه باید مسیر بین دو نقطه‌ی تصویری را هم با انسجام طی کند.

پخش از رسانه

برای مراحل اولیه‌ی کار، خروجی 360p معرفی شده تا توسعه‌دهندگان بتوانند پیش‌نمایش‌های سبک‌ بسازند. گوگل می‌گوید این حالت تا ۶۰ درصد سریع‌تر از تولید استاندارد 720p انجام می‌شود و هزینه‌ای برابر با یک‌سوم آن دارد.

کاربرد چنین مدلی بیشتر در نمونه‌سازی سریع، آزمون استوری‌بورد و رندرهای فوری در پلتفرم‌های توسعه‌ دیده می‌شود. برای تیم‌هایی که مدام پرامپت‌ها را اصلاح می‌کنند، سرعت در این مرحله می‌تواند تفاوت زیادی در روند کار ایجاد کند.

ارتقا تا 4K

Omni 1.1 همچنین امکان تولید خروجی‌های 1080p و 4K را فراهم می‌کند؛ سطحی که برای تولید حرفه‌ای و تحویل نهایی مناسب‌تر است. در نمونه‌های ارائه‌شده از سوی گوگل، صحنه‌هایی مانند حرکت ماهی، سنجاب در حال دویدن و نماهای ماکرو از برگ‌های افرا نشان می‌دهند که مدل تازه فقط برای ایده‌پردازی اولیه نیست و می‌تواند به خروجی‌های پالوده‌تر هم برسد.

پخش از رسانه

تغییر مهم در همین‌جا رخ می‌دهد. یک ابزار واحد حالا می‌تواند هم برای آزمون سریع به کار برود و هم برای نسخه‌ی باکیفیت‌تر نهایی، بدون آن‌که جریان کاری به چند سامانه‌ی جداگانه تقسیم شود.

ویژگی دیگر، پشتیبانی از ویدئوهای مرجع در ورودی چندوجهی است. توسعه‌دهنده می‌تواند تا ۳ ثانیه از ویدئو را به‌عنوان مرجع وارد کند و از آن برای حفظ زمینه‌ی بصری و سازگاری شخصیت‌ها بهره بگیرد.

Google

گوگل برای این قابلیت مثالی هم آورده که در آن، سه شخصیت تصویری با رقص‌های متفاوت در یک فضای مشترک قرار می‌گیرند و خروجی نهایی باید یک نمای پیوسته و بدون برش باشد. چنین کاربردی برای پروژه‌هایی که با شخصیت‌های ثابت، حرکت‌های تکرارشونده و صحنه‌های ترکیبی سروکار دارند، اهمیت عملی دارد.

مسیر عرضه و دسترسی

گوگل اعلام کرده Gemini Omni 1.1 Flash به‌تدریج در سراسر اکوسیستم توسعه‌دهندگان این شرکت منتشر می‌شود. دسترسی اولیه از طریق Google AI Studio ممکن شده و کسب‌وکارها می‌توانند از راه Gemini Enterprise Agent Platform و Agent Platform API سراغ آن بروند.

مستندات رسمی و راهنماهای پرامپت‌نویسی برای پیاده‌سازی قابلیت‌هایی مانند ادامه‌ی صحنه، ویدئوهای مرجع و ارتقای کیفیت در دسترس قرار گرفته‌اند. افزون بر این، Omni 1.1 برای مشترکان Google AI Plus و Pro و Ultra در Google Flow به‌صورت جهانی فعال شده است و قابلیت ادامه‌ی صحنه نیز برای همین مشترکان در اپلیکیشن جمنای ارائه می‌شود.