Google lança Gemini 3.8 Live com avatar animado que sincroniza lábios em tempo real
Leia mais
Olhar Digital
olhardigital.com.br

Google lança Gemini 3.8 Live com avatar animado que sincroniza lábios em tempo real

O Google introduziu uma nova representação visual para o Gemini através do Gemini 3.8 Live, que incorpora o recurso Live Avatar. Esta funcionalidade permite que uma persona animada apareça na tela para interagir com o usuário em um tempo quase real.

Este avatar possui a capacidade de sincronizar os movimentos da boca com a fala, exibir diversas expressões faciais e conduzir conversas de maneira mais natural. O anúncio desta novidade ocorreu na quinta-feira, dia 24, e já está acessível no Gemini Enterprise.

A tecnologia empregada une a geração de vídeo de baixa latência aos recursos de diálogo ao vivo do Gemini. Consequentemente, a inteligência artificial não se limita a responder apenas por voz, mas também oferece uma presença visual durante a interação.

De acordo com o Google, o Live Avatar foi concebido primariamente para usos corporativos, tais como suporte ao cliente e experiências interativas. Além disso, o sistema é capaz de processar dados visuais e de áudio simultaneamente durante as conversas.

As empresas parceiras têm a opção de selecionar entre uma coleção pré-existente de avatares ou desenvolver personagens sob medida. No caso de personalização, os desenvolvedores podem utilizar uma imagem de referência para gerar um avatar animado, mantendo as características visuais, a identidade do personagem ou elementos de uma marca. Contudo, a criação desses avatares personalizados está restrita, no momento, a uma lista específica de companhias autorizadas.

Adicionalmente, o Google assegura que todo o conteúdo produzido por seus produtos de IA é marcado com a marca d'água invisível SynthID, que é integrada tanto ao áudio quanto ao vídeo, visando auxiliar na identificação de material gerado por inteligência artificial.

Próximos avanços nos modelos de IA

Enquanto o Google implementa essa nova modalidade de interação com o Gemini, a companhia também se prepara para o próximo grande avanço em seus modelos de IA. O Gemini 4 encontra-se atualmente em fase de refinamento e tem previsão de lançamento "muito antes" do final de 2026, conforme declarado por Koray Kavukcuoglu, líder do Google DeepMind.

Em uma entrevista concedida ao The Information, Kavukcuoglu manifestou a intenção da empresa de disponibilizar uma versão inicial do modelo logo após a conclusão do treinamento, pois os resultados alcançados até o momento são muito promissores. Ele declarou ao The Information: "Nossa intenção é, tipo — assim que possível — lançar uma versão inicial pós-treinamento porque vemos os resultados e estamos animados". O executivo também mencionou que o Google planeja manter um ritmo acelerado na liberação de novas iterações.

Essa informação foi confirmada por relatórios divulgados na quinta-feira, dia 24, indicando que o Gemini 4 já ingressou na etapa de pós-treinamento, período dedicado ao ajuste do comportamento do modelo antes do seu lançamento. Este processo abrange testes internos e a implementação de salvaguardas de segurança.

Kavukcuoglu assumiu a liderança do Google DeepMind após uma reorganização interna da divisão. Ele já havia abordado publicamente o desenvolvimento do Gemini 4 em setembro, detalhando o progresso do treinamento do novo modelo.

Segundo Kavukcuoglu, o propósito do Google é permanecer na vanguarda do desenvolvimento de IA. Quando questionado sobre a possibilidade de a empresa ficar para trás dos competidores, ele respondeu ao The Information que, em sua perspectiva, é uma "certeza" que o Google sempre estará na fronteira.

O progresso do Gemini 4 acontece paralelamente à expansão da família Gemini 3.8 pelo Google. O Gemini 3.8 Live foi apresentado em setembro como um modelo focado em diálogos em tempo quase real, com capacidade de processar informações visuais, operar em 97 idiomas distintos e executar tarefas em segundo plano durante as conversas. Com o Live Avatar, o Google adiciona uma dimensão visual à experiência: além de escutar e responder, o Gemini passa a se comunicar por meio de uma persona animada, apresentando expressões faciais e sincronia labial em tempo real.

Popular