Google научила нейросеть монтировать видео через чат. На что способна Gemini Omni

Если взглянуть на то, что происходит с искусственным интеллектом прямо сейчас, возникает чувство, что технологические компании только и делают, что стремятся перевернуть представления о создании контента с ног на голову. Google на своей ежегодной конференции в мае 2026 года выкатила нечто, что сложно уложить в голове с первого раза: мультимодальную линейку моделей под названием Gemini Omni. Первая и пока единственная публичная версия серии, Gemini Omni Flash, уже раздается подписчикам и работает так, что даже скептикам есть о чем задуматься. Речь идет не о чате с картинками и не об очередном улучшенном поиске, а о полноценном инструменте для создания и редактирования видео с голосом при помощи обычного текстового диалога. Не нужны ни монтажные программы, ни пресеты. Модель в своей работе опирается на реально существующую информацию, и потому выдает неплохой контент даже в том случае, если использовался достаточно короткий промпт. Вместе с командой Креатор Проджект рассмотрим прочие особенности новой модели от Google.

Смотрите видео на удобном для вас ресурсе!

Что умеет и как работает нейросеть

Концепция, лежащая в основе Omni Flash, достаточно проста, но за ней стоит немало технической работы: модель принимает на вход почти что угодно. Фотографии, текстовые описания, аудиозаписи, уже готовые видеоролики… Все это можно скормить ей одновременно, и на выходе получится один связный видеоклип со звуком. Длина ролика на старте ограничена десятью секундами, и это сознательное решение Google, а не ограничение самой архитектуры. Компания хочет сначала справиться с нагрузкой на серверы, прежде чем открывать доступ к более длинным форматам.

Главное отличие от конкурентов заключается в возможностях диалогового редактирования. Вместо того чтобы каждый раз переписывать промпт с нуля и получать совершенно новый ролик, здесь можно просто написать: «перенеси сцену на пляж» или «поменяй угол камеры». Модель внесет правки и при этом (в большинстве случаев) не сломает логику уже сгенерированного видео. Персонажи остаются теми же. Физика объектов сохраняется, общий смысл не рассыпается. Лишь на первый взгляд все это кажется мелочью. На практике же такого рода детали меняют весь подход к работе с генеративным видео.

Физика в Omni Flash – вообще отдельная тема для разговора. Модель понимает гравитацию, движение жидкостей, кинетику. Google показывала на презентации не только красивые сцены с движущимися объектами, но и научные объяснения в анимированном формате. Например, процесс сворачивания белков в стиле пластилиновой анимации. Конечный результат выглядит убедительно именно потому, что объекты в кадре ведут себя так, как им и положено по законам природы, а не как в старых нейросетевых роликах, в которых вода текла вверх, а руки у людей заканчивались девятью пальцами.

Еще одна возможность, которую Google анонсировала с гордостью, заключается в возможности создания персонального аватара. Пользователь загружает собственные материалы. После этого аватар можно вставлять в новые ролики и генерировать их уже только по текстовому описанию. Редактирование чужого голоса и звука при этом пока недоступно; компания намеренно придерживает эту функцию, пока не проработает механизмы безопасного использования. Судя по тому, как осторожно Google подходит к теме дипфейков, ждать открытия голосового редактора придется не один месяц.

Кому открыт доступ и что с безопасностью?

Схема распространения у Omni Flash неожиданно демократичная (по крайней мере, частично). Подписчики платных планов Google AI Plus, Pro и Ultra получили доступ через приложение Gemini и сервис Google Flow сразу в день запуска. Авторы, работающие с короткими форматами, могут пользоваться инструментом бесплатно через YouTube Shorts и приложение YouTube Create. Разработчики и корпоративные клиенты пока ждут появления API. Google обещала открыть его в течение нескольких недель после анонса.

Что касается безопасности, Google не стала делать вид, что проблемы не существует. Каждый ролик, созданный через Omni Flash, автоматически получает скрытую цифровую метку SynthID. Это невидимый водяной знак, который сохраняется при публикации в социальных сетях и позволяет идентифицировать контент как сгенерированный ИИ. Проверить происхождение видео можно через приложение Gemini, браузерное расширение Gemini в Chrome или обычный поиск Google. Интересно, что SynthID уже приняли на вооружение и другие крупные игроки рынка, среди которых OpenAI, Nvidia, ElevenLabs. Стандарт постепенно становится отраслевым.

Можно ли назвать Gemini Omni Flash лучшей в своем роде?

Называть обозреваемую модель безусловным лидером рынка было бы преувеличением. Независимые тесты показывают, что по чистому качеству генерации некоторые конкуренты пока держат позиции. Однако уникальность Omni Flash не в том, чтобы рисовать самые красивые кадры, а в том, как устроен весь рабочий процесс. Диалоговое редактирование, мультимодальный ввод и глубокая интеграция в уже знакомые платформы вроде YouTube и Google Flow делают его принципиально другим продуктом.

Google анонсировала и следующую модель серии – Omni Pro. По словам представителей компании, она появится тогда, когда будет демонстрировать ощутимый, а не косметический прирост возможностей по сравнению с Flash. Когда именно это произойдет, вопрос пока что открытый. Сейчас же Gemini Omni Flash остается первым публичным шагом Google к тому, что компания сама называет движением в сторону искусственного интеллекта общего назначения. Шаг, надо признать, заметный.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

7 комментариев к “Google научила нейросеть монтировать видео через чат. На что способна Gemini Omni

  1. Я был уверен, что рано или поздно такая штука должна появиться. Этот способ очевидно удобен — во время диалога сразу можно указать на все ошибки, не нужно по-многу раз править промты, думать как бы на этот раз так написать чтобы иишка тебя наконец-то уже понял.

  2. Решил протестировать демо версию. Взял сырой материал с отпуска где куча хаотичных роликов, селфи, смешные моменты. Попросил: смонтируй весёлый ролик про наш поход: включи лучшие кадры, добавь задорную музыку, вставь текстовые вставки вроде ,,приключения начались!,, и ,,вот это вид!,,. В конце добавь логотип нашего семейного чата. Результат: Видео собралось за 3 минуты. Музыка действительно подбавила драйва. Текстовые вставки выглядели стильно не перегружали кадр. Даже цветокоррекция подтянула тусклые кадры, стало выглядеть как профессиональный контент. Конечно я потом чуть подправил пару моментов вручную, но 80% работы сделала нейросеть.

  3. С одной стороны это очень круто,с другой стороны как-то страшновато становится

  4. Профессиональные монтажёры будут менее востребованы для базовых задач например, обрезка, добавление эффектов.

  5. Попробовала Gemini Omni в деле. Честно говоря, впечатлена тем, как нейросеть понимает контекст монтажа. Раньше приходилось вручную подгонять переходы и искать нужные моменты, а тут просто описываешь задачу в чате — и вуаля. Конечно, это не замена профессиональному видеоредактору для сложного продакшена, но для быстрой нарезки контента — это маст-хэв.

  6. Если Gemini Omni действительно умеет монтировать видео по обычным текстовым командам, это может сильно ускорить работу с контентом. Теперь интересно посмотреть, насколько качественно она справляется с реальными проектами, а не только с демо.

  7. С одной стороны удобно: Google дал возможность использовать такой интересный ИИ-инструмент бесплатно в своих приложениях YouTube Shorts и YouTube Create. С другой стороны все-таки компания не прошла мимо возрастающей опасности создания дипфейков и разрабатывает новые меры предотвращения этого. Цифровые метки проверить не каждый сможет. А вот запрет на копирование голоса — может сработать, хотя бы временно до появления более действенных мер.

Обсуждение закрыто.

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности