Um mês antes, Zhang Yimin, fundador da ByteDance, visitou a reunião geral da equipe Seed e encerrou uma disputa interna de dois anos. Ele declarou que a ByteDance não aplicará modelos de outros desenvolvedores para acelerar a criação de seus próprios grandes modelos de linguagem (LLMs), incluindo tanto modelos avançados fechados quanto modelos de pesos abertos.
Esta regra foi estabelecida em 2023. Nas fases iniciais de trabalho da equipe Seed, foram realizados experimentos usando os resultados da API do GPT como dados de treinamento. Após a ByteDance iniciar uma auditoria das chamadas da API do GPT em abril de 2023, a equipe estabeleceu uma regra rigorosa: os dados gerados pelo GPT não devem entrar nos conjuntos de treinamento da ByteDance. Este mecanismo restritivo surgiu antes que qualquer pessoa fora da China começasse a discutir a destilação.
A primeira disputa interna surgiu em janeiro de 2025, após o lançamento do DeepSeek-R1. Os pesquisadores da Seed fizeram uma pergunta óbvia: se outros laboratórios estão secretamente usando os resultados de modelos avançados para recuperar o atraso, por que eles não podem fazer o mesmo? Alguns sugeriram usar cautelosamente resultados destilados para preencher lacunas sem abandonar seu próprio pré-treinamento Seed. A liderança rejeitou essa proposta.
Um ano depois, quando os laboratórios americanos começaram a implementar amplamente as GPUs Nvidia Blackwell, a discussão foi retomada. Os laboratórios chineses não têm condições de adquirir as placas topo de linha da série B. O Seedance 2.0 foi treinado em um cluster H20, cuja performance é de aproximadamente um quinto de B200. O progresso em raciocínio, codificação e ciência alcançado pelos modelos GPT-5.5 e Claude 4.8, especialmente o Claude Fable 5, coincidiu com o surgimento do Blackwell. Embora modelos fechados não possam ser destilados, os melhores modelos de pesos abertos podem.
O ponto que levou a disputa à reunião geral foi o modelo Kimi K3 da Moonshot. O modelo K3 de pesos abertos da Moonshot atingiu um nível comparável aos modelos fechados avançados. Para a Seed, um laboratório chinês relativamente pequeno que almeja entrar no top dez mundial, esta questão tornou-se inevitável: por que a Seed, possuindo maior densidade de talentos e maior potencial computacional, não criou um modelo de linguagem de nível equivalente? A destilação permitiria que a Seed direcionasse recursos de treinamento limitados para áreas que já provaram ser eficazes em outros lugares.
A resposta de Zhang foi concisa. Ele afirmou que a Seed pode se dar ao luxo de um atraso temporário, mas não pode permitir que essa lacuna seja fechada através da destilação de concorrentes. Esta posição está de acordo com a política de 2023, mas as apostas aumentaram significativamente. A Anthropic acusou publicamente Tongyi Qianwen, Moonshot e MiniMax de coleta em massa de resultados do Claude. Independentemente de essas acusações serem verdadeiras ou não, o risco geopolítico, legal e comercial aumentou drasticamente, e a Seed mantém sua posição, mesmo ao custo de um atraso de muitos anos nos benchmarks.
A aposta interessante reside na meta-aposta subjacente à estratégia. A estratégia da Seed pressupõe que os laboratórios que lideram nos benchmarks atuais de raciocínio não liderarão no tipo de inteligência que a Seed tenta criar, e que a apropriação de seus dados agora fixará a Seed em sua arquitetura de inteligência, e não na própria. É uma aposta que Zhang está disposto a assumir, aceitando perdas na posição do modelo, algo que pode ser mais difícil para outros laboratórios chineses.

