Inteligência Artificial

OpenAI compara avanço de modelos abertos chineses a "comunismo da IA" após chegada do Kimi K3

Modelo de IA Kimi K3 da Moonshot AI alcança topo do ranking de geração de código e desafia líderes da indústria como OpenAI e Anthropic.
Imagem de: OpenAI compara avanço de modelos abertos chineses a "comunismo da IA" após chegada do Kimi K3

O lançamento do Kimi K3 colocou a Moonshot AI em evidência ao levar o modelo ao topo do ranking de geração de código da Arena.

Em meio a esse cenário, Dean W. Ball, diretor de Strategic Futures da OpenAI, publicou uma mensagem no X em que associa um futuro dominado por modelos de pesos abertos ao que chamou de "comunismo da IA".

O Kimi K3 é um modelo de código aberto com 2,8 trilhões de parâmetros, criado para tarefas de IA em grande escala. Ele é multimodal, conta com uma janela de contexto de cerca de 1 milhão de tokens e entrega desempenho competitivo, além de velocidade superior à de vários modelos da mesma categoria.

Segundo as informações divulgadas, a Moonshot pode ter usado o Claude, da Anthropic, como base para a destilação do modelo.

Ainda assim, o Kimi K3 traz uma arquitetura própria para gerenciamento do cache KV, chamada Kimi Delta Attention (KDA).

Como funciona o Kimi Delta Attention

O cache KV é um recurso usado para acelerar o processamento dos modelos de IA. Sem ele, o sistema precisaria revisar continuamente todo o conteúdo já processado para lembrar do contexto, o que aumenta o tempo de resposta conforme o texto cresce.

Uma forma simples de entender isso é imaginar alguém escrevendo um texto, mas precisando reler tudo o que já escreveu antes de adicionar cada nova palavra. O cache KV funciona como um conjunto de anotações que evita esse trabalho repetitivo.

Nos modelos tradicionais, baseados em atenção quadrática, o cache KV cresce de forma linear conforme o contexto aumenta. Isso faz com que o volume de dados armazenados também cresça, reduzindo a eficiência.

O Kimi K3 adota uma abordagem híbrida de atenção linear. A arquitetura usa estados recorrentes e um estado de Hybrid Interleaving em uma proporção de 3 para 1.

Na prática, três estados recorrentes mantêm um resumo contínuo das informações mais importantes. Como esse resumo é atualizado constantemente, seu tamanho permanece praticamente o mesmo, mesmo quando o contexto aumenta.

Esse método pode deixar passar detalhes muito específicos. Para compensar essa limitação, o quarto estado cria uma representação compactada de todo o contexto.

Quando o modelo precisa consultar essa visão geral, ele expande temporariamente esses dados, faz a consulta e volta a compactá-los. O funcionamento segue este padrão:

  • Assistente 1 (KDA): mantém um resumo rápido das informações.
  • Assistente 2 (KDA): mantém um resumo rápido das informações.
  • Assistente 3 (KDA): mantém um resumo rápido das informações.
  • Assistente 4 (Global Attention): mantém uma representação completa de todo o contexto.

Como três dos quatro estados usam esse método de memória mais leve, o tamanho do cache KV é reduzido de forma expressiva.

Apesar do ganho de eficiência com o KDA, o consumo total de memória HBM não deve cair, já que o modelo também utiliza outra técnica de otimização chamada WideEP.

OpenAI reage ao crescimento do Kimi K3

Os avanços do Kimi K3 representam uma ameaça direta para OpenAI e Anthropic. Em uma publicação no X, Dean W. Ball classificou os modelos chineses de IA de código aberto como "desaceleracionistas" em relação aos investimentos em infraestrutura (CapEx).

Ele também escreveu que um cenário dominado por modelos de pesos abertos teria como consequência provável um "comunismo da IA", argumentando que esse modelo trataria a inteligência artificial como um bem público fornecido pelo Estado, em vez de um produto de mercado.

Enquanto isso, a Anthropic manteve o acesso ao modelo Fable 5 em seus principais planos de assinatura após o Kimi K3 superar o Opus em destaque.

Mais vistos da semana