
Gemini Omni Flash, новая модель Google, которая создаёт видео из чего угодно
Google выпустила модель, которая не просто создаёт видео по запросу, а позволяет редактировать его обычными словами, как в переписке. Разбираемся, чем Gemini Omni Flash отличается от привычных генераторов видео и в каких задачах она реально экономит время.
Что такое Gemini Omni Flash и откуда она появилась
Год назад Google выпустила Nano Banana, модель для генерации и редактирования изображений, которая помогла миллионам людей восстанавливать старые фото и превращать наброски в готовые картинки. Теперь компания сделала следующий шаг и представила Gemini Omni, новое семейство моделей, которое умеет создавать любой контент из любого входящего материала, начиная с видео.
Первая модель этого семейства называется Gemini Omni Flash. В неё можно одновременно загрузить изображения, аудио, видео и текст, а модель соберёт из всего этого качественное видео, опираясь на реальные знания Gemini о мире. Дальше это видео можно редактировать через обычный диалог, просто описывая словами, что нужно поменять.
Модель уже доступна в приложении Gemini, в Google Flow и в YouTube Shorts. Пока Omni создаёт только видео, но в будущем Google планирует добавить и другие форматы результата, например изображения и звук.
Как редактировать видео обычными словами
Главная особенность Gemini Omni в том, что редактировать видео можно просто описывая нужные изменения словами, без монтажных программ. Каждая следующая правка учитывает предыдущую, персонажи остаются узнаваемыми, физика в кадре не ломается, а модель «помнит», что происходило в сцене раньше.
Можно менять что-то одно конкретное, а можно преобразить всю сцену целиком. По сути видео превращается в отправную точку для чего-то, что невозможно было бы снять камерой в реальности.
Промт: Make the sculpture out of bubbles.
Почему ролики выглядят реалистично, физика и знания о мире
Gemini Omni не просто рисует картинку, которая выглядит реалистично, модель ещё и понимает, что должно произойти дальше в сцене. Она сочетает интуитивное понимание физики с знаниями Gemini об истории, науке и культурном контексте, поэтому результат ближе не только к фотореализму, но и к осмысленному рассказу.
Например, модель лучше понимает такие силы, как гравитация, кинетическая энергия и поведение жидкостей, поэтому сцены получаются более правдоподобными физически.
Промт: A marble rolling fast on a chain reaction style track, continuous smooth shot.
Из чего можно собрать видео или любые референсы сразу
Omni умеет превращать в единый ролик любую комбинацию исходных материалов, будь то картинка, текст, видео или звук. Пока для звука поддерживаются только голосовые референсы, но Google обещает добавить и другие типы аудио в ближайшее время.
Промт: Dynamic sci-fi film style video based on image_0.png. Elements light up similar to video_0.mp4 synchronized to the beat of the music from audio_0.wav
Это значит, что можно, например, дать модели фото продукта, скриншот фирменного стиля и пример движения камеры, а на выходе получить видео, которое учитывает все три исходника одновременно.
Цифровой аватар и защита от подделок
Google добавила функцию Avatars, которая создаёт твою цифровую версию с твоим собственным голосом, чтобы генерировать видео, которое выглядит и звучит как ты. При этом компания пока продолжает тестировать более широкие возможности редактирования звука и речи, чтобы понять, как безопасно предоставить эту функцию пользователям.
Каждое видео, созданное через Omni, получает невидимый цифровой водяной знак SynthID. Проверить, что ролик создан именно нейросетью Gemini, можно прямо в приложении Gemini, браузере Chrome и в поиске Google.
Gemini Omni Flash против Veo 3.1, честное сравнение
Если сравнивать по-честному, Veo 3.1 всё ещё лидирует по чистому кинематографичному качеству картинки и по длине ролика. Но у Veo нет того самого диалогового редактирования, которое и отличает Omni, композиции из нескольких источников и генерации, привязанной к реальным знаниям о мире. Для работы с повторяющимися правками Omni находится в своей отдельной категории, и по сути эти две модели скорее дополняют друг друга, чем конкурируют.

Если ты работаешь с большими объёмами видео, скорее всего, тебе рано или поздно пригодятся обе модели, просто под разные задачи.
Кому эта модель подойдёт больше всего
Разные типы пользователей получают от Omni разную пользу. Вот кому модель пригодится сильнее всего:
Создателям контента и соцсетевым командам, потому что долгий цикл переделки ролика ради одной детали сжимается до короткого диалога
Маркетологам и брендам, благодаря возможности комбинировать фото продукта, стиль бренда и референс движения в одном видео
Преподавателям и авторам обучающих роликов, потому что модель реально понимает предмет, который показывает, будь то анатомия или исторические события
Разработчикам, которым стоит заранее продумать архитектуру своих продуктов под видео-API, отдельный доступ для разработчиков появится в ближайшие недели
Получается, что польза от Omni напрямую зависит от того, сколько видео ты производишь и насколько часто тебе нужно вносить точечные правки, а не переснимать всё заново.
Какие есть ограничения у модели
У Omni есть и вполне реальные рамки, которые стоит знать заранее. Диалоговое редактирование ограничено примерно четырьмя надёжными шагами, а максимальная длина одного ролика составляет 10 секунд, для более длинных историй ролики приходится соединять вручную.
Отдельная сложность, это текст на не-латинских языках внутри кадра, японская и китайская иероглифика распознаётся и отображается ненадёжно. Модерация контента у Omni строже, чем у Veo, а негативные инструкции, то есть просьбы чего-то не делать, соблюдаются не всегда, поэтому результат стоит проверять вручную.
Ни одно из этих ограничений не критично для тех задач, под которые Omni создавалась, но знать о них заранее полезно, чтобы не терять время впустую.
Заключение
Gemini Omni Flash меняет саму логику работы с видео, теперь не нужно пересоздавать весь ролик заново ради одной детали, достаточно просто описать словами, что изменить. При этом у модели есть чёткие рамки, короткие клипы и ограниченное число надёжных правок, которые стоит учитывать при планировании работы.
Проблема в том, что протестировать Gemini Omni, сравнить её с Veo и другими генераторами видео напрямую бывает неудобно, доступ пока привязан к подписке Google AI и не всегда открыт по всему миру одинаково просто.
Именно для этого работает unitool.ai. Оформи одну подписку и получи доступ к самым современным нейросетям для видео и изображений в одном месте, без иностранной карты и лишних сложностей с доступом. Попробуй сам, как Gemini Omni и другие модели справляются именно с твоей задачей.