اخبار هوش مصنوعی

Omni 1.1 Flash

گوگل از جمینای Omni 1.1 Flash رونمایی کرد؛ ساخت ویدیوهای ۴۰ ثانیه‌ای 4K برای توسعه‌دهندگان

گوگل روز چهارشنبه ۲۷ اوت ۲۰۲۶ (۶ شهریور ۱۴۰۵) از مدل جدید تولید ویدیو با هوش مصنوعی خود با نام Gemini Omni 1.1 Flash رونمایی کرد. این مدل که جانشین نسخه‌ی اولیه‌ی Omni Flash محسوب می‌شود، با تمرکز بر افزایش کنترل توسعه‌دهندگان بر فرآیند تولید ویدیو طراحی شده و قابلیت‌هایی نظیر گسترش صحنه تا ۴۰ ثانیه، خروجی با کیفیت 4K، و پیش‌نمایش‌های ارزان‌قیمت ۳۶۰p را به همراه دارد. این مدل هم‌اکنون از طریق Google AI Studio و پلتفرم Gemini Enterprise Agent در دسترس توسعه‌دهندگان قرار گرفته است.

مهم‌ترین قابلیت جدید Gemini Omni 1.1 Flash، ویژگی «گسترش صحنه» (Scene Extension) است. مدل جدید می‌تواند تا ۱۰ ثانیه از ویدیوی قبلی را تحلیل کند تا بتواند دنباله‌ای منسجم و پیوسته از آن تولید کند. این قابلیت نسبت به نسخه‌های قبلی که تنها به یک ثانیه‌ی پایانی ویدیو دسترسی داشتند، بهبود چشمگیری در حفظ تداوم بصری و روایی ایجاد کرده است. کاربران می‌توانند ویدیو را در پله‌های ۱۰ ثانیه‌ای گسترش دهند تا طول نهایی به ۴۰ ثانیه برسد.

علاوه بر این، مدل جدید از کنترل فریم اول و آخر پشتیبانی می‌کند. توسعه‌دهندگان می‌توانند فریم شروع و پایان یک نما را مشخص کنند و مدل ویدیوی بین این دو فریم را به‌صورت پیوسته تولید کند. این ویژگی برای حرکت‌های دوربین، زوم، و ساخت لوپ‌های بدون پرش کاربرد دارد.

پیش‌نمایش ارزان‌قیمت و خروجی 4K

گوگل برای اولین بار در این مدل، قابلیت تولید پیش‌نمایش با کیفیت ۳۶۰p را ارائه کرده است. این پیش‌نمایش‌ها تا ۶۰٪ سریع‌تر از کیفیت استاندارد ۷۲۰p تولید می‌شوند و هزینه‌ی آنها تنها یک‌سوم قیمت نسخه‌ی ۷۲۰p است. این ویژگی به توسعه‌دهندگان امکان می‌دهد تا ایده‌های خود را سریعاً تست کرده و پس از تأیید، خروجی نهایی را با کیفیت ۱۰۸۰p یا 4K تولید کنند.

هزینه‌ی استفاده از این مدل به‌صورت پلکانی و بر اساس کیفیت خروجی تعیین شده است: ۳۶۰p معادل ۰.۰۳ دلار در هر ثانیه، ۷۲۰p معادل ۰.۱۰ دلار، ۱۰۸۰p معادل ۰.۱۵ دلار و 4K معادل ۰.۳۰ دلار در هر ثانیه.

واکنش‌ها و پذیرش در صنعت

بر اساس گزارش‌های منتشرشده، Gemini Omni 1.1 Flash در بنچمارک Text-to-Video Arena با امتیاز ۱,۵۱۵ در جایگاه نخست قرار گرفته و در Image-to-Video Arena نیز رتبه‌ی دوم را کسب کرده است. این مدل در حال حاضر توسط شرکت‌های بزرگی نظیر Adobe (در محصول Firefly)، Figma Weave، GMI Cloud و Runway در محیط‌های تولیدی واقعی به‌کار گرفته شده است.

با این حال، بازخوردهای اولیه در شبکه‌های اجتماعی مانند Reddit تا حدی دوگانه بوده است. برخی کاربران کیفیت خروجی را «معمولی» ارزیابی کرده و معتقدند که تفاوت چندانی با نسخه‌ی قبلی Omni Flash ندارد. همچنین نگرانی‌هایی درباره‌ی هزینه‌ی نهایی تولید یک ویدیوی ۴۰ ثانیه‌ای (حدود ۴ دلار) و همچنین چالش‌های فنی مانند «جابه‌جایی هویت» (identity drift) و محدودیت‌های فیلترهای ایمنی مطرح شده است.

دسترسی و چشم‌انداز آینده

Gemini Omni 1.1 Flash هم‌اکنون از طریق Google AI Studio و Gemini Enterprise Agent Platform API در دسترس توسعه‌دهندگان قرار گرفته است. همچنین کاربران اشتراک‌های Google AI Plus، Pro و Ultra می‌توانند از این مدل در ابزار Google Flow استفاده کنند.

گوگل با معرفی Gemini Omni 1.1 Flash، گامی بلند در جهت حرفه‌ای‌سازی تولید ویدیو با هوش مصنوعی برداشته است. ترکیب کنترل دقیق روی فریم‌ها، امکان گسترش صحنه تا ۴۰ ثانیه، و خروجی 4K، این مدل را به ابزاری قدرتمند برای توسعه‌دهندگان و تولیدکنندگان محتوای حرفه‌ای تبدیل کرده است. با وجود برخی نقدها درباره‌ی کیفیت و هزینه، استقبال اولیه‌ی شرکت‌های بزرگی مانند Adobe نشان‌دهنده‌ی پتانسیل بالای این فناوری در آینده‌ی نزدیک است.

رونمایی از Gemini Omni 1.1 Flash نشان می‌دهد که گوگل با جدیت به دنبال تصاحب جایگاه رهبری در حوزه‌ی تولید ویدیو با هوش مصنوعی است. ارائه‌ی قابلیت‌های حرفه‌ای مانند کنترل فریم‌ها، گسترش صحنه، و خروجی 4K در کنار قیمت‌گذاری منعطف برای پیش‌نمایش‌های ۳۶۰p، این مدل را به گزینه‌ای جذاب برای طیف وسیعی از توسعه‌دهندگان و تولیدکنندگان محتوا تبدیل کرده است. با توجه به استقبال اولیه‌ی شرکت‌های بزرگ و جایگاه این مدل در بنچمارک‌های معتبر، به نظر می‌رسد که Gemini Omni 1.1 Flash بتواند استانداردهای جدیدی در حوزه‌ی تولید ویدیو با هوش مصنوعی تعیین کند.

مشاهده بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

دکمه بازگشت به بالا