Inteligência Artificial WebStory

Kimi K3.1 aparece em código da Moonshot e pode chegar antes de outubro

Kimi K3.1 aparece em código da Moonshot e pode chegar antes de outubro. Relatório aponta origem chinesa em 57% dos principais talentos de IA.
Imagem de: Kimi K3.1 aparece em código da Moonshot e pode chegar antes de outubro

A Moonshot pode lançar o Kimi K3.1 antes de outubro. Referências à próxima versão do modelo de inteligência artificial apareceram em um trecho de código interno da empresa.

O Kimi K3, lançado em julho, teve boa recepção e recebeu elogios. Desde então, usuários e entusiastas de IA aguardam a próxima versão. O código traz o indício mais direto até agora de que a Moonshot prepara esse lançamento.

Em paralelo, um relatório da Carnegie China aponta que 57% dos principais talentos de IA do mundo têm origem chinesa.

Os dados mostram a participação crescente da China na área e os desafios para a liderança tecnológica dos Estados Unidos.

Código da Moonshot traz referências ao Kimi K3.1

Uma publicação de MaxForAI no X mostra um trecho de código interno da Moonshot com respostas em formato JSON/API, usado na troca de dados entre sistemas.

O material inclui os seguintes detalhes:

  • O identificador k3d1-agent, uma referência direta ao Kimi K3.1.
  • Três níveis de esforço de raciocínio: Low, High e Max.
  • Configurações de contexto, incluindo Extra Long, com até 1 milhão de tokens.
  • Modos de agentes, cenários de uso e outras opções, como grupos de agentes, pesquisa e processamento em lote.
  • A previsão apresentada é de lançamento antes de outubro.

Como o Kimi K3 reduz o uso de memória

O Kimi K3 ganhou atenção em julho com a arquitetura Kimi Delta Attention, ou KDA. Ela muda a forma de armazenar o cache KV, um registro de informações usadas durante o processamento do contexto.

Um modelo de IA é formado por uma sequência de blocos chamados transformers. Cada bloco tem dois componentes principais: a camada de atenção e a rede feed-forward, conhecida pela sigla FFN.

A camada de atenção identifica as relações entre as palavras. Na frase Paris é a capital da França, por exemplo, ela associa capital a França e identifica Paris como resposta.

Essa camada, porém, não interpreta o significado de França ou Paris. As relações ficam registradas no cache KV, que cresce à medida que o contexto aumenta.

Já a FFN armazena o conhecimento do modelo em parâmetros chamados pesos. Ela usa cálculos matemáticos para interpretar o significado das palavras.

Ao processar França, por exemplo, essa rede ativa informações relacionadas ao país. Na arquitetura KDA da Moonshot, as três primeiras camadas mantêm um resumo das informações mais importantes.

O tamanho desse registro não cresce com o contexto, pois dados antigos e menos relevantes são apagados. Esse método, porém, deixa lacunas em detalhes muito específicos.

Para corrigir a limitação, cada quarta camada, em uma configuração chamada Hybrid Interleaving, registra o contexto completo e o comprime.

Quando é necessário consultar esse registro completo, os dados são descomprimidos por um breve período e depois comprimidos novamente.

O processo reduz bastante o cache KV e a quantidade necessária de memória, incluindo a HBM, um tipo de memória de alta largura de banda.

Comparação da estrutura e da arquitetura dos modelos
Elemento da arquiteturaDeepSeek V4.1 FlashMoonshot Kimi K3
Arquitetura principalCodificador-decodificador causal (CED)Arquitetura padrão apenas com decodificador, com alterações estruturais
Total de parâmetros552 bilhõesTotal desconhecido, com alta esparsidade
Parâmetros ativos por token8 bilhões no processamento inicial (prefill) e 16 bilhões na decodificaçãoCerca de 50 bilhões
Configuração de mistura de especialistas (MoE)1 especialista compartilhado e 384 especialistas roteados, com 6 ativos896 especialistas no total
Mecanismo principal de atençãoAtenção esparsa comprimida 2 (CSA2)Atenção Kimmy Delta, com atenção linear híbrida

Após o lançamento do Kimi K3, a DeepSeek apresentou o V4.1 Flash. O modelo combina recursos como Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), quantização FP4 e SWA Bounded Replay.

Com essa combinação, o cache KV caiu para apenas 890 bytes por token. Esses recursos são detalhados em uma publicação dedicada ao modelo que fizemos.

Resta saber quais ajustes a Moonshot fará no Kimi K3.1 para competir melhor com a eficiência sem igual do DeepSeek V4.1 Flash.

China concentra a origem de 57% dos principais talentos de IA

Segundo o relatório divulgado pela Carnegie China, 57% dos principais talentos globais de IA têm origem chinesa, ante 46% em 2022. A participação dos profissionais de origem americana é de 13%.

Os números tratam da origem desses pesquisadores, enquanto a movimentação entre países ajuda a explicar a posição dos Estados Unidos na disputa.

Desde 2025, os EUA tiveram um saldo positivo de 2.145 pesquisadores de IA, o que ajudou o país a acompanhar a competição. No mesmo período, a China perdeu 1.729 pesquisadores em termos líquidos.

Segundo a Carnegie, essa circulação entre países está diminuindo, com mais profissionais de IA permanecendo em seus países de origem. Esse cenário representa um sério desafio à liderança tecnológica americana nos próximos anos.

Em outra frente da disputa, Netanyahu também defende que Israel se torne um terceiro polo na corrida pela inteligência artificial geral, conhecida pela sigla AGI.