Pesquisadores da ByteDance Seed publicaram um trabalho científico no qual identificaram uma vulnerabilidade periódica em modelos de linguagem que utilizam a compressão do cache de chave-valor (KV-cache) em blocos fixos. Essa abordagem é aplicada, por exemplo, no modelo DeepSeek-V4 para reduzir os custos de memória e atenção ao lidar com contextos longos.
No artigo intitulado «Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression», publicado no arXiv em 28 de setembro, a equipe relatou que a mesma informação pode ser facilmente extraída em uma posição, mas difícil de acessar em outra. Essa falha pode passar despercebida ao usar métricas de avaliação padrão.
O método de compressão por blocos agrupa tokens sequenciais em janelas e comprime cada janela para um número menor de registros no cache com um passo fixo. Isso atribui a cada token uma nova coordenada, que os autores chamam de sua fase — ou seja, sua posição em relação aos limites da janela. Mesmo um pequeno deslocamento dos dados de entrada em alguns tokens pode alterar o grupo de tokens que são comprimidos juntos, sem alterar seu conteúdo real.
A equipe testou versões baseadas e ajustadas do DeepSeek-V4-Flash e DeepSeek-V4-Pro, bem como o DeepSeek-V4.1-Flash ajustado. Os testes foram realizados na tarefa de busca «agulha no palheiro» com um volume de 128 mil tokens, mantendo o comprimento da consulta e a posição absoluta constantes. A precisão nos pontos de controle básicos variou em até 40,2 pontos percentuais dependendo da fase do elemento alvo. Embora o ajuste tenha aumentado a precisão e estreitado as lacunas, elas permaneceram significativas para os modelos V4.
O modelo DeepSeek-V4.1-Flash, que usa um passo de dois em vez de quatro, demonstrou a menor lacuna, embora o padrão periódico persistisse. Para descobrir a causa, os pesquisadores pré-treinaram uma família de pequenos transformadores do zero com base no backbone Qwen3-0.6B, alterando apenas o design de compressão KV. Cada variação comprimida mostrou periodicidade correspondente ao seu passo, incluindo uma variante que simplesmente calcula a média dos tokens em cada janela, enquanto os modelos de atenção base completos não demonstravam isso.
As intervenções nos cabeçalhos de atenção indicam que os autores chamaram de especialização de fase, pois diferentes componentes processam informações em fases diferentes. Eles observam que essas conclusões mecanicistas são mais fortes em condições controladas e não estabelecem uma causa universal para modelos grandes.
A relevância prática deste trabalho diz mais respeito aos métodos de avaliação do que a qualquer modelo específico. O artigo afirma que os modelos que usam compressão de KV por blocos devem ser avaliados levando em conta as fases. Por exemplo, isso pode ser feito deslocando os dados de entrada em alguns tokens enquanto mantém a informação solicitada inalterada, pois alta precisão média pode coexistir com falhas posicionais sistemáticas.
Os oito autores listaram ByteDance Seed como afiliação. Três também listaram a Universidade de Princeton, a Universidade de Stanford ou a Universidade da Califórnia em Berkeley, e o artigo afirma que os principais participantes realizaram este trabalho durante estágios na ByteDance Seed. Os autores correspondentes são Yiyuan Ma e Xin Dong.
