Google научила ИИ делать видео с вашим лицом. Обзор модели Gemini Avatar

Технологии добираются до вещей, которые еще совсем недавно казались уделом голливудских студий с многомиллионными бюджетами. Исторически создание высококачественного цифрового двойника или обучение кастомной голосовой модели требовало специализированного программного обеспечения и дорогостоящего оборудования. А также, разумеется, многих часов работы.

Google решила сократить этот путь до пяти минут и встроить результат прямо в приложение Gemini. Функция называется Gemini Avatar и работает на базе новой модели Gemini Omni, представленной на Google I/O в мае 2026 года. Работает она достаточно просто: пользователь один раз записывает лицо и голос, после чего система умеет генерировать видеоролики, в которых он появляется в совершенно произвольных сценах. То есть, в ситуациях, которые никогда в жизни не снимал. Вместе с экспертами Креатор Проджект поговорим о том, что представляет собой данное решение от Google.

Смотрите видео на удобном для вас ресурсе!

Как работает Gemini Avatar

Создать аватар можно прямо в приложении Gemini через раздел Settings, затем Avatar. Процесс регистрации несложный: нужно записать лицо и голос, следуя подсказкам на экране. Система просит посмотреть в камеру, повернуть голову и произнести вслух определенные числа, чтобы точно зафиксировать структуру лица и особенности голоса. На все это уходит буквально несколько минут. После завершения настройки Google привязывает цифровой двойник к аккаунту пользователя. С этого момента аватар живет прямо в инструментарии Gemini и готов к использованию в любой момент.

Дальше все выглядит неожиданно просто. Достаточно начать новый чат в Gemini, нажать кнопку добавления вложения, выбрать аватар из меню и написать запрос: например, «сними видео, где я нахожусь в подкаст-студии и рассказываю о новинках технологий». Видео генерируется несколько минут в фоновом режиме. Готовый ролик появляется прямо в окне чата. Тут же можно попросить что-то изменить: к примеру, фон, интонацию или тему разговора. Все осуществляется без перезапуска с нуля.

Текущая версия Gemini Omni Flash ограничивает длину клипов десятью секундами. Google называет это выбором при развертывании, а не ограничением самой модели. Более длинные ролики ожидаются от версии Omni Pro. При этом качество мимики, синхронизации губ и воспроизведения голосовых интонаций оказывается достаточно убедительным, чтобы вызвать легкое головокружение при просмотре.

Чем модель отличается от предшественников

Gemini Avatar является частью более широкого обновления видеогенерации в экосистеме Google. Новая модель сочетает в себе интеллект Gemini с продвинутыми возможностями генерации медиаконтента, в том числе преобразование изображения в видео, а также редактирование видео при помощи ИИ.

Система объединяет то, что раньше требовало цепочки из четырех-шести отдельных инструментов, в единый процесс сквозной генерации с возможностью диалогового уточнения вместо повторного запуска с самого начала. Герои сцен сохраняют лицо, одежду и реквизит от кадра к кадру; все перечисленное – те моменты, которые долгое время оставались слабым местом конкурирующих видеомоделей. Звуковое сопровождение и диалоги создаются в том же проходе, что и само видео. Именно это и стоит за словом «omni» в названии.

Безопасность использования. Недостатки

Функция такого рода неизбежно поднимает вопросы о дипфейках и возможных злоупотреблениях. Google подошла к этому с несколькими уровнями защиты. Создавать аватар разрешено только пользователям старше 18 лет, и при регистрации владелец аккаунта должен физически присутствовать в процессе записи.

Все видеоролики, созданные в приложении, содержат встроенный водяной знак SynthID, разработанный Гугл для идентификации контента, сгенерированного искусственным интеллектом. Проверить, является ли клип результатом работы ИИ, можно через Gemini или инструменты Google Search. Удалить аватар можно в любой момент, и компания обещает при этом стереть все биометрические данные, использованные при создании.

Функция носит исключительно добровольный характер. Только владелец аккаунта может использовать собственный аватар для создания видео. Создавать аватар другого человека без его участия система не позволяет.

Кому и для чего пригодится

Доступ к опции создания аватаров открыт для платных подписчиков Google AI Plus, Pro или Ultra. Аудитория, которой реально пригодится опция, понятна сразу: создатели контента, которым нужно быстро записать объяснение или обзор без камеры и монтажа. Также модель оценят небольшие компании, которым нужны обучающие ролики или демонстрации продукта с живым ведущим.

На данный момент функция доступна в приложении для платных подписчиков в поддерживаемых регионах. API для разработчиков пока не запущен, компания обещает его в ближайшие недели. Бесплатно поэкспериментировать с моделью Omni Flash можно через YouTube Shorts и приложение YouTube Create, хотя аватарная функция там недоступна. То есть, данная модель – это уже не концепт и не демонстрация на конференции. Она работает сейчас, и именно это делает новинку интересной для наблюдения.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

4 комментария к “Google научила ИИ делать видео с вашим лицом. Обзор модели Gemini Avatar

  1. ОК, теперь у каждого будет своя цифровая копия — вопрос только в том, кто будет управлять этим двойником, когда мы спим :)) Надеюсь, кнопка «удалить» будет работать так же быстро, как кнопка «создать».

  2. Решил потестировать демо версию. Взял пару селфи, записал голосовое сообщение: пивет ребята сегодня я расскажу вам о новом проекте и через пару минут получил готовое видео. Мимика и движения головы выглядят натурально особенно если исходные фото качественные. Синхронизация речи и движений губ на уровне: почти не заметно, что это ИИ. Можно настраивать эмоции: сделать аватара более серьёзным, весёлым или задумчивым. Есть нюансы: иногда мимика немного дергается в сложных выражениях, но для бытовых задач это не критично.

  3. Посмотрела обзор на Gemini Avatar и, честно говоря, смешанные чувства. С одной стороны — это просто фантастика, насколько реалистично ИИ копирует мимику и голос. Представляю, как это упростит жизнь тем, кто ведет блоги или делает обучающие курсы. Но с другой — немного жутковато от того, насколько легко теперь можно подделать человека. Технологии развиваются с бешеной скоростью, даже не знаю, радоваться этому или бояться. Но как инструмент для работы — штука мощная, тут не поспоришь

Добавить комментарий

Оставляя комментарий вы соглашаетесь на обработку персональных данных в соответствии с политикой конфиденциальности, соглашаетесь с пользовательским соглашением. Ваш адрес email не будет опубликован. Обязательные поля помечены *

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности