ByteDance está pré-treinando um modelo de IA com 10 trilhões de parâmetros — uma escala que posicionaria um laboratório chinês dentro do alcance da classe Mythos de ponta da Anthropic pela primeira vez. O Financial Times reportou o projeto na sexta-feira, citando pessoas com conhecimento do assunto. ByteDance não comentou. A contagem de parâmetros não é final; 10 trilhões é o alvo de trabalho.
A lacuna de escala dentro da China é notável. O Kimi K3 da Moonshot, o maior modelo entregue por um laboratório chinês, possui 2.8 trilhões de parâmetros. Antes do Kimi K3 chegar em julho, o LongCat-2.0 da Meituan e o V4-Pro da DeepSeek compartilhavam o recorde doméstico em 1.6 trilhão. A Alibaba respondeu ao Kimi K3 em poucas semanas com um flagship Qwen de 2.4 trilhões de parâmetros. ByteDance em 10 trilhões ultrapassaria todos eles por uma margem substancial e se aproximaria da estimativa de analistas que colocam o Mythos 5 da Anthropic em aproximadamente 8 trilhões de parâmetros e seu Fable 5 mais amplamente disponível em cerca de 5 trilhões. Anthropic e OpenAI não publicam contagens oficiais de parâmetros; esses números são estimativas de analistas, não especificações confirmadas.
O modelo está em pré-treinamento inicial, um estágio que normalmente dura três a seis meses antes que o ajuste fino comece. A Moonshot usou aproximadamente 20.000 chips Nvidia para treinar o Kimi K3. A necessidade de compute de ByteDance para uma execução de 10-trilhões-de-parâmetros é proporcionalmente maior — e não resolvida. Controles de exportação dos EUA restringiram o acesso da China aos aceleradores mais avançados. Que ByteDance consiga obter hardware compatível suficiente para terminar o treinamento em um cronograma razoável permanece uma questão em aberto.
O Mythos da Anthropic não é para lançamento geral. O acesso é restrito a parceiros verificados sob o Project Glasswing, dados os preocupações documentadas sobre as capacidades do sistema em hacking agêntico e exploração de vulnerabilidades. Fable 5, a contraparte enrijecida em segurança, atinge um público mais amplo. ByteDance construindo em direção à escala Mythos nomeia o nível em relação ao qual está fazendo benchmark — não o amplamente disponível.
A mensagem interna do fundador Zhang Yiming, emitida dias antes da história do FT, aguça a intenção. Ele disse ao staff para parar de confiar em destilação de modelo para ganhos de curto prazo e para construir capacidade genuína em vez disso. Essa instrução se insere em uma disputa diplomática em curso: a Casa Branca acusou a Moonshot de destilar o Fable 5 da Anthropic para produzir o Kimi K3. Moonshot rejeita a alegação. Uma execução de pré-treinamento de 10-trilhões-de-parâmetros é a refutação mais cara disponível — é fisicamente impossível destilar seu caminho para um modelo tão grande sem uma fonte maior. O compromisso de compute é também o argumento.
Duas vantagens estruturais tornam a aposta de ByteDance mais defensável do que seria para uma pura loja de pesquisa. Seu assistente Doubao já lidera o mercado de IA de consumidor da China, fornecendo tanto sinal de treinamento de escala quanto um canal de implantação pronto que pode converter investimento em pesquisa em receita de produto quase imediatamente. A empresa também mantém os pesos de seus modelos gerais mais fortes em privado, ao contrário da maioria dos pares chineses que entregam pesos abertos. Um sistema de 10-trilhões-de-parâmetros, se for entregue, permanece proprietário.
Para arquitetos avaliando o cenário de IA da China: estratégias de catch-up baseadas em destilação são politicamente insustentáveis. ByteDance acabou de apostar que compute de ponta é mais barato que o custo reputacional desse caminho.