گوگل با معرفی Gemini Omni 1.1 Flash مجموعهای از ابزارهای خلاقانه و قابلیت تولید ویدئو را پیش روی توسعهدهندگان گذاشت؛ مجموعهای که هدفش سادهتر کردن ساخت ابزارها، ویرایش محتوای چند رسانهای و جریانهای کاری ویدئویی است.
بر اساس بیانیهی مطبوعاتی گوگل، نسخهی تازهی Omni با اتکا به Gemini API در Google AI Studio به مرحلهی آمادهسازی برای استفادهی حرفهای رسیده و قرار است تولید ویدئو را قابلکنترلتر، سریعتر و مناسبتر برای استقرار در محیط واقعی کند.
یکی از مهمترین ویژگیهای جدید، Scene Extension یا ادامهدادن صحنه است. توسعهدهنده میتواند یک ویدئوی موجود را بگیرد و از همان نقطه، تولید را ادامه دهد؛ بدون آنکه پیوستگی تصویر از بین برود.
پخش از رسانه
در Omni 1.1، مدل میتواند تا ۱۰ ثانیه زمینهی قبلی را تحلیل کند؛ جهشی محسوس نسبت به مدلهای قبلی که فقط به آخرین ثانیه تکیه میکردند. نتیجه، ثبات بصری بهتر و وفاداری بیشتر به روایت است. تولید در گامهای ۱۰ ثانیهای انجام میشود و طول تجمعی ویدئو میتواند تا ۴۰ ثانیه برسد.
گوگل برای این قابلیت نمونهای هم ارائه کرده که در آن توسعهدهنده با همان شناسهی تعامل قبلی، درخواست ادامهی صحنه را به مدل میفرستد. در چنین سناریویی، تمرکز روی امتداد طبیعی داستان است، نه ساختن یک برش تازه از صفر.
کنترل آغاز و پایان نما
قابلیت بعدی، تعیین فریم آغاز و پایان هر نما است. Omni 1.1 میتواند بین دو فریم کلیدی، ویدئویی پیوسته بسازد؛ موضوعی که برای حرکتهای پیچیدهی دوربین، چرخشهای نمایشی و زومهای نرم کاربرد دارد.
نمونههای مطرحشده در توضیحات گوگل، از نماهای نزدیک و حرکت سریع دوربین تا صحنههای موسیقایی و رقص را دربر میگیرند. پیام اصلی روشن است: مدل تازه قرار نیست فقط یک کلیپ بسازد، بلکه باید مسیر بین دو نقطهی تصویری را هم با انسجام طی کند.
پخش از رسانه
برای مراحل اولیهی کار، خروجی 360p معرفی شده تا توسعهدهندگان بتوانند پیشنمایشهای سبک بسازند. گوگل میگوید این حالت تا ۶۰ درصد سریعتر از تولید استاندارد 720p انجام میشود و هزینهای برابر با یکسوم آن دارد.
کاربرد چنین مدلی بیشتر در نمونهسازی سریع، آزمون استوریبورد و رندرهای فوری در پلتفرمهای توسعه دیده میشود. برای تیمهایی که مدام پرامپتها را اصلاح میکنند، سرعت در این مرحله میتواند تفاوت زیادی در روند کار ایجاد کند.
ارتقا تا 4K
Omni 1.1 همچنین امکان تولید خروجیهای 1080p و 4K را فراهم میکند؛ سطحی که برای تولید حرفهای و تحویل نهایی مناسبتر است. در نمونههای ارائهشده از سوی گوگل، صحنههایی مانند حرکت ماهی، سنجاب در حال دویدن و نماهای ماکرو از برگهای افرا نشان میدهند که مدل تازه فقط برای ایدهپردازی اولیه نیست و میتواند به خروجیهای پالودهتر هم برسد.
پخش از رسانه
تغییر مهم در همینجا رخ میدهد. یک ابزار واحد حالا میتواند هم برای آزمون سریع به کار برود و هم برای نسخهی باکیفیتتر نهایی، بدون آنکه جریان کاری به چند سامانهی جداگانه تقسیم شود.
ویژگی دیگر، پشتیبانی از ویدئوهای مرجع در ورودی چندوجهی است. توسعهدهنده میتواند تا ۳ ثانیه از ویدئو را بهعنوان مرجع وارد کند و از آن برای حفظ زمینهی بصری و سازگاری شخصیتها بهره بگیرد.
گوگل برای این قابلیت مثالی هم آورده که در آن، سه شخصیت تصویری با رقصهای متفاوت در یک فضای مشترک قرار میگیرند و خروجی نهایی باید یک نمای پیوسته و بدون برش باشد. چنین کاربردی برای پروژههایی که با شخصیتهای ثابت، حرکتهای تکرارشونده و صحنههای ترکیبی سروکار دارند، اهمیت عملی دارد.
مسیر عرضه و دسترسی
گوگل اعلام کرده Gemini Omni 1.1 Flash بهتدریج در سراسر اکوسیستم توسعهدهندگان این شرکت منتشر میشود. دسترسی اولیه از طریق Google AI Studio ممکن شده و کسبوکارها میتوانند از راه Gemini Enterprise Agent Platform و Agent Platform API سراغ آن بروند.
مستندات رسمی و راهنماهای پرامپتنویسی برای پیادهسازی قابلیتهایی مانند ادامهی صحنه، ویدئوهای مرجع و ارتقای کیفیت در دسترس قرار گرفتهاند. افزون بر این، Omni 1.1 برای مشترکان Google AI Plus و Pro و Ultra در Google Flow بهصورت جهانی فعال شده است و قابلیت ادامهی صحنه نیز برای همین مشترکان در اپلیکیشن جمنای ارائه میشود.