Google выпустил Gemini 3.8 Live с анимированным аватаром, синхронизирующим губы в реальном времени
Подробнее
Olhar Digital
olhardigital.com.br

Google выпустил Gemini 3.8 Live с анимированным аватаром, синхронизирующим губы в реальном времени

Google представил новое визуальное представление Gemini через Gemini 3.8 Live, которое включает функцию Live Avatar. Эта функция позволяет анимированному персонажу появляться на экране для взаимодействия с пользователем почти в реальном времени.

Этот аватар способен синхронизировать движения рта с речью, отображать различные выражения лица и вести диалог более естественно. Анонс этой новинки состоялся в четверг, 24-го числа, и уже доступен в Gemini Enterprise.

Используемая технология объединяет генерацию видео с низкой задержкой с функциями живого диалога Gemini. Следовательно, искусственный интеллект не ограничивается ответами только голосом, но также предлагает визуальное присутствие во время взаимодействия.

По данным Google, Live Avatar был разработан в первую очередь для корпоративного использования, такого как поддержка клиентов и интерактивный опыт. Кроме того, система способна одновременно обрабатывать визуальные и аудиоданные во время разговоров.

Партнеры-компании имеют возможность выбрать из существующей коллекции аватаров или разработать индивидуальных персонажей. В случае персонализации разработчики могут использовать изображение-референс для создания анимированного аватара, сохраняя визуальные характеристики, личность персонажа или элементы бренда. Однако создание этих персонализированных аватаров в настоящее время ограничено списком авторизованных компаний.

Кроме того, Google гарантирует, что весь контент, созданный его продуктами ИИ, маркируется невидимой водяной меткой SynthID, которая интегрирована как в аудио, так и в видео, чтобы помочь в идентификации материалов, сгенерированных искусственным интеллектом.

Ближайшие достижения в моделях ИИ

Пока Google внедряет эту новую модальность взаимодействия с Gemini, компания также готовится к следующему большому прорыву в своих моделях ИИ. Gemini 4 в настоящее время находится на стадии доработки и, по прогнозам, будет выпущен «гораздо раньше» конца 2026 года, как заявил Корай Кавукчуоглу, руководитель Google DeepMind.

В интервью The Information Кавукчуоглу выразил намерение компании выпустить первоначальную версию модели вскоре после завершения обучения, поскольку достигнутые на данный момент результаты очень многообещающи. Он заявил The Information: «Наше намерение — как можно скорее выпустить первоначальную версию после обучения, потому что мы видим результаты и нам это нравится». Руководитель также упомянул, что Google планирует поддерживать быстрый темп выпуска новых итераций.

Эта информация была подтверждена отчетами, опубликованными в четверг, 24-го числа, которые указывают на то, что Gemini 4 уже вступил в стадию пост-обучения, период, посвященный настройке поведения модели перед ее выпуском. Этот процесс включает внутреннее тестирование и внедрение мер безопасности.

Кавукчуоглу возглавил Google DeepMind после внутренней реорганизации подразделения. Он ранее публично обсуждал разработку Gemini 4 в сентябре, подробно описывая прогресс обучения новой модели.

По словам Кавукчуоглу, цель Google — оставаться на переднем крае разработки ИИ. Когда его спросили о возможности отстать от конкурентов, он ответил The Information, что, по его мнению, «это наверняка» Google всегда будет на переднем крае.

Прогресс Gemini 4 происходит параллельно с расширением семейства Gemini 3.8 компанией Google. Gemini 3.8 Live был представлен в сентябре как модель, ориентированная на диалоги в почти реальном времени, со способностью обрабатывать визуальную информацию, работать на 97 различных языках и выполнять фоновые задачи во время разговоров. С Live Avatar Google добавляет визуальное измерение к опыту: помимо прослушивания и ответа, Gemini начинает общаться с помощью анимированного персонажа, демонстрируя мимику и синхронность губ в реальном времени.

Популярное