Google выпустил Gemini с возможностью рассуждения во время голосового общения
Подробнее
Olhar Digital
olhardigital.com.br

Google выпустил Gemini с возможностью рассуждения во время голосового общения

Google во вторник (15-го числа) представил две новые модели искусственного интеллекта (ИИ), ориентированные на голосовое взаимодействие: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Компания разработала эти инновации с целью сделать общение с ИИ более сложным и естественным, а также позволить системам выполнять сложные задачи, продолжая диалог с пользователем.

Эти модели представляют собой самые продвинутые версии Google для диалогов в реальном времени. Основное различие заключается в способности к рассуждению: в то время как Gemini 3.8 Live отдает приоритет голосовому взаимодействию с высокой эффективностью и масштабируемостью, Gemini 3.8 Live Extended Thinking включает функции более глубокого рассуждения и многофазной обработки.

Возможность одновременного рассуждения

Gemini 3.8 Live Extended Thinking выходит за рамки простого разговора; он разработан для управления более сложными задачами, требующими многоэтапной обработки и логики. Примечательным аспектом, отмеченным Google, является способность ИИ рассуждать и говорить одновременно. Это позволяет системе оставаться вовлеченной в диалог с пользователем, выполняя при этом более объемную работу.

Вместо того чтобы молчать во время обработки, система может выдавать естественные ответы, используя такие фразы, как «позвольте мне это проверить для вас», пока выполняет необходимые шаги в фоновом режиме. Кроме того, ИИ способен подробно описывать прогресс выполнения сложных задач по мере их завершения.

Интеграция в продукты и сервисы

Новые функции не ограничиваются разработкой приложений. Google внедряет Gemini 3.8 Live Extended Thinking в различные продукты и сервисы. В Google Workspace эта технология будет интегрирована в голосовые функции для Docs, Gmail и Keep. Например, функция Docs Live позволяет пользователям использовать голосовые команды для выполнения действий внутри документа. Аналогичные принципы применяются к Gmail Live и Keep Live.

Модель также внедряется в Search Live, облегчая голосовое взаимодействие, которое включает инструкции в реальном времени и пошаговые указания. Google также представил результаты тестов для подтверждения возможностей Gemini 3.8 Live Extended Thinking. Модель заняла первое место в общем зачете, набрав 82,6 балла в Индексе качества преобразования речи в речь (Speech to Speech Quality Index), разработанном Artificial Analysis, который измеряет качество голосового взаимодействия. В другом тесте, τ-Voice, сфокусированном на выполнении задач агентами, она показала 68,6%, а в бенчмарке τ-Voice-banking, специфичном для финансов, — 35,1%.

Gemini 3.8 Live уже доступен разработчикам через Gemini API и Google AI Studio. Компании могут получить доступ через бета-версию Gemini Enterprise, в то время как обычные пользователи смогут использовать его через Search Live. Gemini 3.8 Live Extended Thinking также начал предоставляться через Gemini API и Google AI Studio для разработчиков и доступен в бета-версии Gemini Enterprise. Для конечных пользователей эта технология интегрируется в приложение Gemini и в функции Workspace. В Google Docs функция доступна для подписчиков планов Google AI Pro и Google AI Ultra, в то время как Gmail Live и Keep Live становятся доступны подписчикам планов Google AI Plus, Google AI Pro и Google AI Ultra.

Популярное