O Google introduziu uma nova representação visual para o Gemini através do Gemini 3.8 Live, que incorpora o recurso Live Avatar. Esta funcionalidade permite que uma persona animada apareça na tela para interagir com o usuário em um tempo quase real.
Este avatar possui a capacidade de sincronizar os movimentos da boca com a fala, exibir diversas expressões faciais e conduzir conversas de maneira mais natural. O anúncio desta novidade ocorreu na quinta-feira, dia 24, e já está acessível no Gemini Enterprise.
A tecnologia empregada une a geração de vídeo de baixa latência aos recursos de diálogo ao vivo do Gemini. Consequentemente, a inteligência artificial não se limita a responder apenas por voz, mas também oferece uma presença visual durante a interação.
De acordo com o Google, o Live Avatar foi concebido primariamente para usos corporativos, tais como suporte ao cliente e experiências interativas. Além disso, o sistema é capaz de processar dados visuais e de áudio simultaneamente durante as conversas.
As empresas parceiras têm a opção de selecionar entre uma coleção pré-existente de avatares ou desenvolver personagens sob medida. No caso de personalização, os desenvolvedores podem utilizar uma imagem de referência para gerar um avatar animado, mantendo as características visuais, a identidade do personagem ou elementos de uma marca. Contudo, a criação desses avatares personalizados está restrita, no momento, a uma lista específica de companhias autorizadas.
Adicionalmente, o Google assegura que todo o conteúdo produzido por seus produtos de IA é marcado com a marca d'água invisível SynthID, que é integrada tanto ao áudio quanto ao vídeo, visando auxiliar na identificação de material gerado por inteligência artificial.
Próximos avanços nos modelos de IA
Enquanto o Google implementa essa nova modalidade de interação com o Gemini, a companhia também se prepara para o próximo grande avanço em seus modelos de IA. O Gemini 4 encontra-se atualmente em fase de refinamento e tem previsão de lançamento "muito antes" do final de 2026, conforme declarado por Koray Kavukcuoglu, líder do Google DeepMind.
Em uma entrevista concedida ao The Information, Kavukcuoglu manifestou a intenção da empresa de disponibilizar uma versão inicial do modelo logo após a conclusão do treinamento, pois os resultados alcançados até o momento são muito promissores. Ele declarou ao The Information: "Nossa intenção é, tipo — assim que possível — lançar uma versão inicial pós-treinamento porque vemos os resultados e estamos animados". O executivo também mencionou que o Google planeja manter um ritmo acelerado na liberação de novas iterações.
Essa informação foi confirmada por relatórios divulgados na quinta-feira, dia 24, indicando que o Gemini 4 já ingressou na etapa de pós-treinamento, período dedicado ao ajuste do comportamento do modelo antes do seu lançamento. Este processo abrange testes internos e a implementação de salvaguardas de segurança.
Kavukcuoglu assumiu a liderança do Google DeepMind após uma reorganização interna da divisão. Ele já havia abordado publicamente o desenvolvimento do Gemini 4 em setembro, detalhando o progresso do treinamento do novo modelo.
Segundo Kavukcuoglu, o propósito do Google é permanecer na vanguarda do desenvolvimento de IA. Quando questionado sobre a possibilidade de a empresa ficar para trás dos competidores, ele respondeu ao The Information que, em sua perspectiva, é uma "certeza" que o Google sempre estará na fronteira.
O progresso do Gemini 4 acontece paralelamente à expansão da família Gemini 3.8 pelo Google. O Gemini 3.8 Live foi apresentado em setembro como um modelo focado em diálogos em tempo quase real, com capacidade de processar informações visuais, operar em 97 idiomas distintos e executar tarefas em segundo plano durante as conversas. Com o Live Avatar, o Google adiciona uma dimensão visual à experiência: além de escutar e responder, o Gemini passa a se comunicar por meio de uma persona animada, apresentando expressões faciais e sincronia labial em tempo real.
