A Moonshot pode lançar o Kimi K3.1 antes de outubro. Referências à próxima versão do modelo de inteligência artificial apareceram em um trecho de código interno da empresa.
O Kimi K3, lançado em julho, teve boa recepção e recebeu elogios. Desde então, usuários e entusiastas de IA aguardam a próxima versão. O código traz o indício mais direto até agora de que a Moonshot prepara esse lançamento.
Em paralelo, um relatório da Carnegie China aponta que 57% dos principais talentos de IA do mundo têm origem chinesa.
Os dados mostram a participação crescente da China na área e os desafios para a liderança tecnológica dos Estados Unidos.
- Leia também: Apple diz que iPhones rodam IA local de 14 bilhões de parâmetros e Macs passam de 1,6 trilhão
Código da Moonshot traz referências ao Kimi K3.1
Uma publicação de MaxForAI no X mostra um trecho de código interno da Moonshot com respostas em formato JSON/API, usado na troca de dados entre sistemas.
O material inclui os seguintes detalhes:
- O identificador k3d1-agent, uma referência direta ao Kimi K3.1.
- Três níveis de esforço de raciocínio: Low, High e Max.
- Configurações de contexto, incluindo Extra Long, com até 1 milhão de tokens.
- Modos de agentes, cenários de uso e outras opções, como grupos de agentes, pesquisa e processamento em lote.
- A previsão apresentada é de lançamento antes de outubro.
🔥K3.1已确认泄露!!
Coming Soon~ pic.twitter.com/kYf3G1Iuki
— Max For AI (@MaxForAI) September 23, 2026
Como o Kimi K3 reduz o uso de memória
O Kimi K3 ganhou atenção em julho com a arquitetura Kimi Delta Attention, ou KDA. Ela muda a forma de armazenar o cache KV, um registro de informações usadas durante o processamento do contexto.
Um modelo de IA é formado por uma sequência de blocos chamados transformers. Cada bloco tem dois componentes principais: a camada de atenção e a rede feed-forward, conhecida pela sigla FFN.
A camada de atenção identifica as relações entre as palavras. Na frase Paris é a capital da França, por exemplo, ela associa capital a França e identifica Paris como resposta.
Essa camada, porém, não interpreta o significado de França ou Paris. As relações ficam registradas no cache KV, que cresce à medida que o contexto aumenta.
Já a FFN armazena o conhecimento do modelo em parâmetros chamados pesos. Ela usa cálculos matemáticos para interpretar o significado das palavras.
Ao processar França, por exemplo, essa rede ativa informações relacionadas ao país. Na arquitetura KDA da Moonshot, as três primeiras camadas mantêm um resumo das informações mais importantes.
O tamanho desse registro não cresce com o contexto, pois dados antigos e menos relevantes são apagados. Esse método, porém, deixa lacunas em detalhes muito específicos.
Para corrigir a limitação, cada quarta camada, em uma configuração chamada Hybrid Interleaving, registra o contexto completo e o comprime.
Quando é necessário consultar esse registro completo, os dados são descomprimidos por um breve período e depois comprimidos novamente.
O processo reduz bastante o cache KV e a quantidade necessária de memória, incluindo a HBM, um tipo de memória de alta largura de banda.
| Elemento da arquitetura | DeepSeek V4.1 Flash | Moonshot Kimi K3 |
|---|---|---|
| Arquitetura principal | Codificador-decodificador causal (CED) | Arquitetura padrão apenas com decodificador, com alterações estruturais |
| Total de parâmetros | 552 bilhões | Total desconhecido, com alta esparsidade |
| Parâmetros ativos por token | 8 bilhões no processamento inicial (prefill) e 16 bilhões na decodificação | Cerca de 50 bilhões |
| Configuração de mistura de especialistas (MoE) | 1 especialista compartilhado e 384 especialistas roteados, com 6 ativos | 896 especialistas no total |
| Mecanismo principal de atenção | Atenção esparsa comprimida 2 (CSA2) | Atenção Kimmy Delta, com atenção linear híbrida |
Após o lançamento do Kimi K3, a DeepSeek apresentou o V4.1 Flash. O modelo combina recursos como Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), quantização FP4 e SWA Bounded Replay.
Com essa combinação, o cache KV caiu para apenas 890 bytes por token. Esses recursos são detalhados em uma publicação dedicada ao modelo que fizemos.
- Leia também: OpenAI corta preços do GPT-6 Sol e Luna pela metade
Resta saber quais ajustes a Moonshot fará no Kimi K3.1 para competir melhor com a eficiência sem igual do DeepSeek V4.1 Flash.
China concentra a origem de 57% dos principais talentos de IA
Segundo o relatório divulgado pela Carnegie China, 57% dos principais talentos globais de IA têm origem chinesa, ante 46% em 2022. A participação dos profissionais de origem americana é de 13%.
Os números tratam da origem desses pesquisadores, enquanto a movimentação entre países ajuda a explicar a posição dos Estados Unidos na disputa.
Desde 2025, os EUA tiveram um saldo positivo de 2.145 pesquisadores de IA, o que ajudou o país a acompanhar a competição. No mesmo período, a China perdeu 1.729 pesquisadores em termos líquidos.
The U.S. and China are looking to reopen dialogue on AI. As “pacing the frontier” on AI competition hangs in the balance, the competition for the talent behind the technology continues apace.
Today, Carnegie China launches Who’s Ahead in the Global AI Talent Race?
Our… pic.twitter.com/lWuq5FahF1
— Carnegie China (@CarnegieChina) September 23, 2026
Segundo a Carnegie, essa circulação entre países está diminuindo, com mais profissionais de IA permanecendo em seus países de origem. Esse cenário representa um sério desafio à liderança tecnológica americana nos próximos anos.
Em outra frente da disputa, Netanyahu também defende que Israel se torne um terceiro polo na corrida pela inteligência artificial geral, conhecida pela sigla AGI.
Netanyahu on AI:
I am setting a goal: within five years, we will be the third AI power.
There is the United States, there is China — not small countries — but I want Israel to become, and with God’s help it will become, the third power. pic.twitter.com/PLXHRBdRkh
— Clash Report (@clashreport) September 23, 2026








