Omni 1.1 Flash
گوگل از جمینای Omni 1.1 Flash رونمایی کرد؛ ساخت ویدیوهای ۴۰ ثانیهای 4K برای توسعهدهندگان

گوگل روز چهارشنبه ۲۷ اوت ۲۰۲۶ (۶ شهریور ۱۴۰۵) از مدل جدید تولید ویدیو با هوش مصنوعی خود با نام Gemini Omni 1.1 Flash رونمایی کرد. این مدل که جانشین نسخهی اولیهی Omni Flash محسوب میشود، با تمرکز بر افزایش کنترل توسعهدهندگان بر فرآیند تولید ویدیو طراحی شده و قابلیتهایی نظیر گسترش صحنه تا ۴۰ ثانیه، خروجی با کیفیت 4K، و پیشنمایشهای ارزانقیمت ۳۶۰p را به همراه دارد. این مدل هماکنون از طریق Google AI Studio و پلتفرم Gemini Enterprise Agent در دسترس توسعهدهندگان قرار گرفته است.
مهمترین قابلیت جدید Gemini Omni 1.1 Flash، ویژگی «گسترش صحنه» (Scene Extension) است. مدل جدید میتواند تا ۱۰ ثانیه از ویدیوی قبلی را تحلیل کند تا بتواند دنبالهای منسجم و پیوسته از آن تولید کند. این قابلیت نسبت به نسخههای قبلی که تنها به یک ثانیهی پایانی ویدیو دسترسی داشتند، بهبود چشمگیری در حفظ تداوم بصری و روایی ایجاد کرده است. کاربران میتوانند ویدیو را در پلههای ۱۰ ثانیهای گسترش دهند تا طول نهایی به ۴۰ ثانیه برسد.
علاوه بر این، مدل جدید از کنترل فریم اول و آخر پشتیبانی میکند. توسعهدهندگان میتوانند فریم شروع و پایان یک نما را مشخص کنند و مدل ویدیوی بین این دو فریم را بهصورت پیوسته تولید کند. این ویژگی برای حرکتهای دوربین، زوم، و ساخت لوپهای بدون پرش کاربرد دارد.
پیشنمایش ارزانقیمت و خروجی 4K
گوگل برای اولین بار در این مدل، قابلیت تولید پیشنمایش با کیفیت ۳۶۰p را ارائه کرده است. این پیشنمایشها تا ۶۰٪ سریعتر از کیفیت استاندارد ۷۲۰p تولید میشوند و هزینهی آنها تنها یکسوم قیمت نسخهی ۷۲۰p است. این ویژگی به توسعهدهندگان امکان میدهد تا ایدههای خود را سریعاً تست کرده و پس از تأیید، خروجی نهایی را با کیفیت ۱۰۸۰p یا 4K تولید کنند.
هزینهی استفاده از این مدل بهصورت پلکانی و بر اساس کیفیت خروجی تعیین شده است: ۳۶۰p معادل ۰.۰۳ دلار در هر ثانیه، ۷۲۰p معادل ۰.۱۰ دلار، ۱۰۸۰p معادل ۰.۱۵ دلار و 4K معادل ۰.۳۰ دلار در هر ثانیه.
واکنشها و پذیرش در صنعت
بر اساس گزارشهای منتشرشده، Gemini Omni 1.1 Flash در بنچمارک Text-to-Video Arena با امتیاز ۱,۵۱۵ در جایگاه نخست قرار گرفته و در Image-to-Video Arena نیز رتبهی دوم را کسب کرده است. این مدل در حال حاضر توسط شرکتهای بزرگی نظیر Adobe (در محصول Firefly)، Figma Weave، GMI Cloud و Runway در محیطهای تولیدی واقعی بهکار گرفته شده است.
با این حال، بازخوردهای اولیه در شبکههای اجتماعی مانند Reddit تا حدی دوگانه بوده است. برخی کاربران کیفیت خروجی را «معمولی» ارزیابی کرده و معتقدند که تفاوت چندانی با نسخهی قبلی Omni Flash ندارد. همچنین نگرانیهایی دربارهی هزینهی نهایی تولید یک ویدیوی ۴۰ ثانیهای (حدود ۴ دلار) و همچنین چالشهای فنی مانند «جابهجایی هویت» (identity drift) و محدودیتهای فیلترهای ایمنی مطرح شده است.
دسترسی و چشمانداز آینده
Gemini Omni 1.1 Flash هماکنون از طریق Google AI Studio و Gemini Enterprise Agent Platform API در دسترس توسعهدهندگان قرار گرفته است. همچنین کاربران اشتراکهای Google AI Plus، Pro و Ultra میتوانند از این مدل در ابزار Google Flow استفاده کنند.
گوگل با معرفی Gemini Omni 1.1 Flash، گامی بلند در جهت حرفهایسازی تولید ویدیو با هوش مصنوعی برداشته است. ترکیب کنترل دقیق روی فریمها، امکان گسترش صحنه تا ۴۰ ثانیه، و خروجی 4K، این مدل را به ابزاری قدرتمند برای توسعهدهندگان و تولیدکنندگان محتوای حرفهای تبدیل کرده است. با وجود برخی نقدها دربارهی کیفیت و هزینه، استقبال اولیهی شرکتهای بزرگی مانند Adobe نشاندهندهی پتانسیل بالای این فناوری در آیندهی نزدیک است.
رونمایی از Gemini Omni 1.1 Flash نشان میدهد که گوگل با جدیت به دنبال تصاحب جایگاه رهبری در حوزهی تولید ویدیو با هوش مصنوعی است. ارائهی قابلیتهای حرفهای مانند کنترل فریمها، گسترش صحنه، و خروجی 4K در کنار قیمتگذاری منعطف برای پیشنمایشهای ۳۶۰p، این مدل را به گزینهای جذاب برای طیف وسیعی از توسعهدهندگان و تولیدکنندگان محتوا تبدیل کرده است. با توجه به استقبال اولیهی شرکتهای بزرگ و جایگاه این مدل در بنچمارکهای معتبر، به نظر میرسد که Gemini Omni 1.1 Flash بتواند استانداردهای جدیدی در حوزهی تولید ویدیو با هوش مصنوعی تعیین کند.




