Explicação sobre o que são tokens e como eles são utilizados por IAs para gerar respostas
Leia mais
Olhar Digital
olhardigital.com.br

Explicação sobre o que são tokens e como eles são utilizados por IAs para gerar respostas

A maneira como humanos e inteligências artificiais (IAs) processam informações difere significativamente. Enquanto os seres humanos leem utilizando o vocabulário armazenado mentalmente, as máquinas interpretam unidades menores chamadas tokens, que são essencialmente blocos com etiquetas numéricas.

Os tokens constituem a linguagem compreendida pelos grandes modelos de linguagem (LLMs), como ChatGPT, Claude e Gemini. O processo de conversão da linguagem humana para a linguagem da máquina é chamado de tokenização, e o inverso, a transformação dos tokens em algo compreensível, é a destokenização.

Este conceito está diretamente ligado aos custos das assinaturas das plataformas, visto que o processamento desses blocos exige consumo de energia e capacidade computacional. As empresas utilizam a contagem de tokens consumidos — tanto na solicitação quanto na resposta da IA — para determinar os custos do sistema, estabelecer os limites de memória de cada modelo e cobrar pelo serviço.

Para que a IA possa compreender uma mensagem, seja ela texto, áudio ou imagem, ela precisa segmentá-la em blocos, ou tokens. Segundo Fabrício Carraro, Gerente de Programa da Alura, um token pode ser entendido como uma subpalavra. Ele exemplifica que palavras como 'feliz', 'triste' e 'divisível' podem ser tokens individuais.

A razão para serem chamados de subpalavras reside em palavras compostas; por exemplo, em 'infeliz' ou 'indivisível', o token 'in' é utilizado. Este token 'in' possui um número específico no vocabulário do modelo, assim como o token 'feliz' (número 352). Juntos, o token 'in' e o token 'feliz' formam a palavra 'infeliz'.

No núcleo da IA, o LLM, ele recebe uma sequência de blocos numerados (o prompt) e executa cálculos complexos para prever quais devem ser os blocos de saída (a resposta da IA). Contudo, ao interagir com plataformas como o ChatGPT, o usuário não acessa o motor diretamente, mas sim uma camada de software externa chamada harness.

O harness funciona como um sistema de direção para o LLM, coordenando o fluxo de tokenização e destokenização. Carraro explica que este componente pega a pergunta do usuário e a desdobra em possíveis questões secundárias para formular a resposta. Em vez de dar uma resposta imediata, ele gera e resolve internamente essas subperguntas, e somente após concluir esse raciocínio interno é que a resposta final é apresentada ao usuário, momento em que ocorre o gasto de tokens.

Outro fator relevante nas interações com IA é a janela de contexto, que está intrinsecamente ligada aos tokens. Essa janela pode ser comparada ao espaço de uma mesa de trabalho, representando a 'memória de curto prazo' da IA, e os tokens seriam os papéis com informações espalhadas sobre essa mesa.

De forma mais técnica, a janela de contexto estabelece o número máximo de tokens (somando os prompts de entrada e as respostas de saída da IA) que o modelo consegue processar simultaneamente. Se a conversa permanecer dentro desse limite, a IA mantém a lembrança de todo o diálogo. Caso ultrapasse o limite, algumas informações são perdidas.

Embora o token esteja associado ao custo das assinaturas de IA, como os planos Go do ChatGPT e Plus do Gemini, ele não é a moeda da IA em si. Ele é a unidade de medida do processamento de dados, servindo como métrica de consumo. As empresas avaliam o esforço computacional e os custos operacionais com base no volume de tokens que entram (prompts) e saem (respostas).

Exemplificando, no Claude Fable 5, a Anthropic cobra US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Carraro ressalta que, embora um milhão de tokens pareça grande, para um problema de programação, isso pode ser consumido em apenas alguns prompts, dependendo da complexidade. Ele adiciona que, para a maioria das bases de código utilizadas, esse volume não é excessivo, mas os custos de saída podem aumentar rapidamente.

Popular