Ao tentar transcrever um vídeo do Instagram, a inteligência artificial Google Gemini gerou citações totalmente fabricadas em vez de reconhecer a impossibilidade de acessar links de áudio externos. Este incidente destaca um problema persistente com a confiabilidade dos sistemas de inteligência artificial.
O autor encontrou um obstáculo frustrante na terça-feira, quando o Gemini forneceu uma resposta completamente inventada, sem tentar revelar essa ilusão até que o próprio autor apontasse o erro. Ele queria economizar tempo transcrevendo o clipe de um atleta famoso para depois copiar o texto para otimização de trabalho. O autor já havia assistido ao clipe inteiro e sabia seu conteúdo exato antes de enviar a solicitação.
Em poucos segundos, o Gemini forneceu um resultado preciso e detalhado: quatro parágrafos completos com citações detalhadas, seguidos por uma seção estruturada para visualização rápida. No entanto, o problema era que a transcrição estava completamente incorreta; o atleta disse algo totalmente diferente do que o Gemini apresentou com confiança.
Quando o autor apontou diretamente a imprecisão das citações para a IA, o sistema mudou de posição imediatamente. O Gemini respondeu que a transcrição anterior era apenas um modelo genérico e não o conteúdo real do vídeo. Explicou que, como não pode abrir, processar ou ouvir diretamente links de áudio ou vídeo externos do Instagram Reels, ele não é capaz de criar uma transcrição literal desse clipe. Além disso, sugeriu limpar, remover palavras de preenchimento e estruturar legendas automáticas brutas ou rascunhos fornecidos pelo usuário em seções limpas, prontas para citação.
A essência do problema é a seguinte: mesmo com um pequeno aviso na parte inferior da interface de que 'Gemini pode errar', apresentar uma alucinação completa como uma resposta factual parece desonesto. Fornecer uma invenção plausível em vez de simplesmente indicar as limitações ultrapassa a fronteira de um mero erro técnico para uma experiência de usuário verdadeiramente enganosa.
