O lançamento do Kimi K3 colocou a Moonshot AI em evidência ao levar o modelo ao topo do ranking de geração de código da Arena.
Em meio a esse cenário, Dean W. Ball, diretor de Strategic Futures da OpenAI, publicou uma mensagem no X em que associa um futuro dominado por modelos de pesos abertos ao que chamou de "comunismo da IA".
O Kimi K3 é um modelo de código aberto com 2,8 trilhões de parâmetros, criado para tarefas de IA em grande escala. Ele é multimodal, conta com uma janela de contexto de cerca de 1 milhão de tokens e entrega desempenho competitivo, além de velocidade superior à de vários modelos da mesma categoria.
Segundo as informações divulgadas, a Moonshot pode ter usado o Claude, da Anthropic, como base para a destilação do modelo.
Ainda assim, o Kimi K3 traz uma arquitetura própria para gerenciamento do cache KV, chamada Kimi Delta Attention (KDA).
Como funciona o Kimi Delta Attention
O cache KV é um recurso usado para acelerar o processamento dos modelos de IA. Sem ele, o sistema precisaria revisar continuamente todo o conteúdo já processado para lembrar do contexto, o que aumenta o tempo de resposta conforme o texto cresce.
Uma forma simples de entender isso é imaginar alguém escrevendo um texto, mas precisando reler tudo o que já escreveu antes de adicionar cada nova palavra. O cache KV funciona como um conjunto de anotações que evita esse trabalho repetitivo.
Nos modelos tradicionais, baseados em atenção quadrática, o cache KV cresce de forma linear conforme o contexto aumenta. Isso faz com que o volume de dados armazenados também cresça, reduzindo a eficiência.
- Leia tambem: StepX apresenta celular com IA enquanto Apple e OpenAI disputam roubo de tecnologia na Justiça
O Kimi K3 adota uma abordagem híbrida de atenção linear. A arquitetura usa estados recorrentes e um estado de Hybrid Interleaving em uma proporção de 3 para 1.
Na prática, três estados recorrentes mantêm um resumo contínuo das informações mais importantes. Como esse resumo é atualizado constantemente, seu tamanho permanece praticamente o mesmo, mesmo quando o contexto aumenta.
Esse método pode deixar passar detalhes muito específicos. Para compensar essa limitação, o quarto estado cria uma representação compactada de todo o contexto.
Quando o modelo precisa consultar essa visão geral, ele expande temporariamente esses dados, faz a consulta e volta a compactá-los. O funcionamento segue este padrão:
- Assistente 1 (KDA): mantém um resumo rápido das informações.
- Assistente 2 (KDA): mantém um resumo rápido das informações.
- Assistente 3 (KDA): mantém um resumo rápido das informações.
- Assistente 4 (Global Attention): mantém uma representação completa de todo o contexto.
Como três dos quatro estados usam esse método de memória mais leve, o tamanho do cache KV é reduzido de forma expressiva.
Secondly, although Kimi Delta Attention has up to 10× lower networking requirements for KV-cache transfers, its large weights require even more network bandwidth to implement an optimization called WideEP, which spreads the weights across different GPUs. 3/8🧵 pic.twitter.com/68Y0pmwOEC
— SemiAnalysis (@SemiAnalysis_) July 17, 2026
Apesar do ganho de eficiência com o KDA, o consumo total de memória HBM não deve cair, já que o modelo também utiliza outra técnica de otimização chamada WideEP.
Some observations on Kimi:
1. It's a very good model! I don't think its performance can be explained away by distillation or anything like that. In agentic coding sessions, it seems pretty much on par with the best public models of Q1 2026. In my fairly limited use, it also…
— Dean W. Ball (@deanwball) July 17, 2026
OpenAI reage ao crescimento do Kimi K3
Os avanços do Kimi K3 representam uma ameaça direta para OpenAI e Anthropic. Em uma publicação no X, Dean W. Ball classificou os modelos chineses de IA de código aberto como "desaceleracionistas" em relação aos investimentos em infraestrutura (CapEx).
Ele também escreveu que um cenário dominado por modelos de pesos abertos teria como consequência provável um "comunismo da IA", argumentando que esse modelo trataria a inteligência artificial como um bem público fornecido pelo Estado, em vez de um produto de mercado.
🤣🤣🤣🤣🤣
This is why open source is so important
Kimi mogged Opus so hard
Ant was forced to keep Fable in the subscription https://t.co/qwEuOMKI4u— Zephyr (@zephyr_z9) July 18, 2026
Enquanto isso, a Anthropic manteve o acesso ao modelo Fable 5 em seus principais planos de assinatura após o Kimi K3 superar o Opus em destaque.
