Google lança Gemini com capacidade de raciocínio durante conversas por voz
Leia mais
Olhar Digital
olhardigital.com.br

Google lança Gemini com capacidade de raciocínio durante conversas por voz

O Google divulgou, nesta terça-feira (15), dois novos modelos de inteligência artificial (IA) focados em interações vocais: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. A empresa desenvolveu essas inovações com o objetivo de tornar as conversas com IA mais sofisticadas e naturais, além de possibilitar que os sistemas executem atividades complexas enquanto mantêm o diálogo com o usuário.

Estes modelos representam as versões mais avançadas do Google para diálogos em tempo real. A distinção fundamental reside na habilidade de raciocínio: enquanto o Gemini 3.8 Live prioriza interações de voz com alta eficiência e escala, o Gemini 3.8 Live Extended Thinking incorpora funcionalidades de raciocínio mais aprofundado e processamento multifásico.

Capacidade de Raciocínio Simultâneo

O Gemini 3.8 Live Extended Thinking transcende a mera conversação, sendo concebido para gerenciar tarefas mais intrincadas que demandam processamento e lógica em múltiplas etapas. Um aspecto notável destacado pelo Google é a aptidão da IA para raciocinar e falar ao mesmo tempo. Isso permite que o sistema continue engajado com o usuário enquanto realiza um trabalho mais extenso.

Em vez de permanecer em silêncio durante o processamento, o sistema pode emitir respostas naturais, utilizando frases como «deixe-me verificar isso para você», enquanto executa as etapas necessárias em segundo plano. Adicionalmente, a IA tem a capacidade de detalhar o progresso de tarefas complexas à medida que estas são concluídas.

Integração em Produtos e Serviços

As novas funcionalidades não se limitarão apenas ao desenvolvimento de aplicações. O Google está implementando o Gemini 3.8 Live Extended Thinking em diversos produtos e serviços. No Google Workspace, essa tecnologia será integrada a recursos de voz para Docs, Gmail e Keep. Por exemplo, o recurso Docs Live permite que os usuários utilizem comandos de voz para executar ações dentro de um documento. Princípios semelhantes são aplicados ao Gmail Live e ao Keep Live.

O modelo também está sendo introduzido no Search Live, facilitando interações por voz que incluem orientações em tempo real e instruções passo a passo. O Google também apresentou resultados de testes para comprovar as competências do Gemini 3.8 Live Extended Thinking. O modelo alcançou o primeiro lugar geral, somando 82,6 pontos no Speech to Speech Quality Index, desenvolvido pela Artificial Analysis, que mede a qualidade da interação por voz. Em outro teste, o τ-Voice, focado na execução de tarefas por agentes, obteve 68,6%, e no benchmark τ-Voice-banking, específico para finanças, registrou 35,1%.

O Gemini 3.8 Live já está acessível a desenvolvedores através da Gemini API e do Google AI Studio. As empresas podem obter acesso via uma prévia privada do Gemini Enterprise, enquanto usuários comuns poderão utilizá-lo pelo Search Live. O Gemini 3.8 Live Extended Thinking também começou a ser disponibilizado na Gemini API e no Google AI Studio para desenvolvedores e está disponível em prévia privada no Gemini Enterprise. Para os usuários finais, a tecnologia está sendo incorporada ao aplicativo Gemini e a recursos do Workspace. No Google Docs, o recurso está disponível para assinantes dos planos Google AI Pro e Google AI Ultra, enquanto o Gmail Live e o Keep Live chegam aos assinantes dos planos Google AI Plus, Google AI Pro e Google AI Ultra.

Popular