От Google Translate к Gemini. Новая модель приближает синхронный перевод к живому диалогу

Двадцать лет назад Google Translate был всего лишь одним из первых машинных экспериментов с языком. Сначала он переводил коряво и смешно, потом сносно. Потом вполне прилично. Но одна проблема долгое время оставалась нерешенной: система всегда ждала, пока собеседник закончит говорить, и только потом начинала переводить. Разговор через такой переводчик напоминал не живую беседу, а сеанс связи с задержкой, в котором каждый участник вынужден терпеть паузы и смотреть в потолок. 9 июня 2026 года Google представила новую аудиомодель для перевода речи в режиме реального времени более чем на 70 языков. Именно она должна наконец закрыть этот раздражающий пробел.

Смотрите видео на удобном для вас ресурсе!

Как работает потоковый перевод

Основополагающее отличие от предыдущих подходов кроется в принципе обработки звука. Классический машинный перевод работает пошагово: система ждет окончания предложения, обрабатывает его и только потом выдает переведенную версию. Это вводит паузу, которая разрушает ритм диалога. Новая модель Live Translate устроена иначе. Система обрабатывает речь по мере поступления аудиосигнала и выдает перевод с задержкой в несколько секунд. Такой подход помогает снизить количество пауз и разрывов в диалоге.

Здесь есть тонкий момент, который Google признает открыто. Модель балансирует между двумя противоположными требованиями: с одной стороны, нужно дождаться достаточного контекста, чтобы перевести качественно, потому что многие языки ставят глагол или отрицание в конце предложения. С другой, нужно выдавать перевод немедленно, чтобы оставаться в синхроне с говорящим. Найти равновесие между этими двумя требованиями – в этом и состоит главная инженерная задача, которую пришлось решать разработчикам.

 

Пример перевода в приложении, перевод с русского на английский

 

Отдельная деталь, которая делает результат ощутимо человечнее: нейросеть автоматически распознает более 70 языков, и при этом сохраняются оригинальная интонация, а также темп речи и высота голоса говорящего. То есть, это уже не просто перевод слов. Система пытается передать эмоциональную окраску речи, а не выдать одинаково ровный роботизированный голос вне зависимости от того, кто и с какими интонациями говорит на входе.

 

Перевод с русского на немецкий

 

Где появится и как использовать

Обозреваемая функция уже начала внедряться в экосистему Google и появляется сразу в нескольких сервисах. В приложении Google Translate функция Live Translate интегрирована в привычный интерфейс и не требует сложной настройки. Перевод запускается прямо во время разговора и может выводиться через подключенные наушники, что делает общение более естественным и непрерывным. Система автоматически подстраивает голос перевода под исходную речь, стараясь сохранить интонации и ритм говорящего. Если гарнитура недоступна, предусмотрен альтернативный режим: перевод можно слушать через динамик смартфона, просто приблизив устройство к уху во время диалога.

Обновление можно считать особенно значимым в плане корпоративного использования. В Google Meet поддержка языков расширяется с пяти до более чем 70, а количество языковых комбинаций внутри одной встречи превышает 2000. Предыдущая версия системы требовала обязательного наличия английского языка. Теперь данное ограничение снимается. Международный созвон с участниками из разных стран, каждый из которых говорит на родном языке, перестает быть коммуникативным кошмаром.

Кто уже тестирует и что с ограничениями

Среди первых партнеров, тестирующих технологию, значится малайзийская технологическая компания Grab. Организация использует модель для голосового общения между водителями и пассажирами в режиме реального времени в многоязычной среде. Там таких звонков происходит более десяти миллионов в месяц. Запрос живой: людям нужно быстро объяснить маршрут или место встречи, не переключаясь на текстовые переписки и не ища переводчика в браузере.

Через API сторонние разработчики получают возможность встраивать синхронный перевод в собственные приложения. По сути, компания открывает технологию синхронного перевода для любого приложения, которое занимается голосовыми коммуникациями.

При этом Google не скрывает ограничений и минусов своего продукта. Система не идеальна: сгенерированные голоса могут быть непоследовательными и слегка менять тембр на протяжении сессии. Автоматическое распознавание языка может давать сбои при нестандартном акценте, при языках, схожих друг с другом, или когда говорящий быстро переключается с одного языка на другой. Но такое признание скорее внушает доверие, чем разочаровывает.

Разумеется, эта функция не решает проблему языкового барьера раз и навсегда. Но это первый инструмент, который всерьез приближается к тому, чтобы сделать разговор между людьми, говорящими на разных языках, похожим на обычную беседу, а не на упражнение в терпении.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

Добавить комментарий

Оставляя комментарий вы соглашаетесь на обработку персональных данных в соответствии с политикой конфиденциальности, соглашаетесь с пользовательским соглашением. Ваш адрес email не будет опубликован. Обязательные поля помечены *

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности