A OpenAI atribuiu a pessoas ligadas à Moonshot AI, responsável pelo Kimi K3, uma campanha para extrair o raciocínio protegido de seus modelos de inteligência artificial.
Segundo a OpenAI, a ação não quebrou a criptografia, não comprometeu bancos de dados nem deu acesso direto a conversas armazenadas de usuários.
O grupo, porém, conseguiu manipular interações com os modelos para reproduzir conteúdo protegido em respostas visíveis a quem fazia os pedidos. A extração foi coordenada, feita em grande volume e violou os termos de uso da OpenAI.
A empresa trata o caso como parte de uma prática recorrente ligada à Moonshot AI. As acusações se somam às da Anthropic e do governo Trump, feitas meses antes.
Como foi a extração de raciocínio dos modelos
Os detalhes estão na publicação da OpenAI intitulada "Interrupção de uma campanha coordenada de destilação de modelos". Essa prática envolve copiar o raciocínio de outros modelos.
De acordo com as informações publicadas, a atividade começou em 1º de julho, perto da estreia do Kimi K3. No início, o volume era baixo, mas houve picos nos dias 24 e 25 daquele mês.
Nesses dois dias, a OpenAI identificou 16 mil pedidos com um padrão de extração, feitos por mais de 4 mil usuários. O método consistia em copiar o raciocínio criptografado de uma conversa.
Em outra, o grupo pedia a um modelo que decifrasse e transcrevesse o conteúdo oculto. Ao todo, o padrão de pedidos apareceu em um grupo com mais de 15 mil usuários.
- Leia também: OpenAI corta preços do GPT-6 Sol e Luna pela metade
Segundo a OpenAI, a campanha foi totalmente interrompida até 28 de julho. A atribuição à Moonshot se refere a um núcleo da atividade. A OpenAI associou esse grupo a pessoas ligadas ao laboratório que desenvolve o Kimi.
Governo dos EUA também fez acusações sobre o Kimi K3
No fim de julho, Michael Kratsios também tratou do assunto. Ele é assessor-chefe de Ciência e Tecnologia e diretor do Escritório de Política Científica e Tecnológica da Casa Branca, o OSTP.
Segundo Kratsios, o governo dos Estados Unidos tinha informações de que a Moonshot havia usado a destilação de modelos da Anthropic para desenvolver o Kimi K3.
Um estudo recente também analisou a relação entre esses modelos. Os pesquisadores inseriram no Kimi K3 apenas 1% de um trecho do raciocínio decodificado do Claude Opus 4.8.
Depois disso, tanto o raciocínio quanto a resposta final do Kimi mudaram bastante e passaram a acompanhar o estilo e a escolha de palavras do Claude.
Segundo os autores, trechos específicos de raciocínio do Claude e do GPT são até cerca de um milhão de vezes mais fáceis de extrair do Kimi K3 do que do segundo modelo mais suscetível.
O estudo mostrou uma probabilidade estatística incomum de o Kimi prever e continuar textos do Claude, em comparação com outros modelos abertos, como o DeepSeek-V4-Flash. Esse comportamento sugere forte compatibilidade com os padrões de raciocínio do Claude Opus.
Moonshot também fez otimizações próprias
Essas observações não significam que a Moonshot não tenha feito contribuições próprias. O Kimi K3 é bastante eficiente quando executado em equipamentos de data centers.
- Leia também: OpenAI vê risco de IA usar calor do processador para se comunicar entre computadores sem internet
Isso se deve à forte redução do cache KV, memória usada no processamento, e a ajustes no uso de memória por token, unidade de texto processada pelo modelo.
Esses ganhos foram alcançados com a distribuição de seus 896 componentes especializados, chamados de experts, entre um grande número de GPUs.
Two months after our reasoning extraction attack release, we audited mitigations introduced since then and found that we still can extract reasoning from Astra/Sol-6.1 via third-party API providers.
We disclosed our findings to OpenAI and Anthropic...https://t.co/KyGHbLnXRr
— Alexander Panfilov (@kotekjedi_ml) September 30, 2026
Modelos recentes da OpenAI também tiveram raciocínio extraído
Os modelos mais novos da OpenAI também não estão livres desses ataques. Um novo estudo descreveu como extrair trechos de raciocínio do GPT-6 Astra e do GPT-6.1 Sol. A extração foi feita por APIs de terceiros, interfaces usadas por serviços para acessar os modelos.
Fascinating.
«GLM-5.3 develops full control flow hijacks in 4% of the trials; Claude Mythos Preview did so in 6%. Although GLM-5.3 performs below Claude Mythos Preview here, a meaningful threshold has clearly been crossed: earlier models, like Claude Opus 4.6 and GLM-5.2, do not… https://t.co/S5jxydVbZp pic.twitter.com/XAelhFc7fm— Teortaxes▶️ (DeepSeek 推特🐋铁粉 2023 – ∞) (@teortaxesTex) September 29, 2026
Em testes recentes da Anthropic, a Z.ai, também chamada de Zhipu, foi o único laboratório chinês a se aproximar da capacidade do Claude Mythos.
Seu modelo GLM-5.3 conseguiu desenvolver ataques de tomada total de controle em 4% das tentativas. O Mythos chegou a 6%.
Os dados mostram o avanço dos modelos chineses, em parte por pesquisa própria e em parte pela destilação de raciocínios de modelos avançados da Anthropic e da OpenAI.








