Modelo DeepSeek V4 usa 27% dos FLOPs e 10% do cache KV, ampliando contexto e reduzindo custos de hardware.
Romário Leite · 29 de abril de 2026
DeepSeek V4 consome apenas 27% dos FLOPs por token e 10% do cache de chave‑valor, comparado ao V3.2.
Com janela de um milhão de tokens, o modelo processa mais texto antes de liberar memória, facilitando a fase Decode.
Na etapa Decode, o modelo guarda o contexto da fase Prefill, exigindo mais memória por causa do cache KV.
Menor uso de cache pode gerar perda de detalhes, conhecido como efeito "agulha no palheiro", afetando a exatidão das respostas.
Reduzir o cache KV alivia a pressão sobre DRAM e HBM, ajudando a conter a escassez e o aumento de preços de memória.
MLA comprime chaves e valores em uma representação menor, expandindo-os só na hora do cálculo, o que corta o consumo de memória.
TecFoco