TecFoco
Inteligência Artificial

DeepSeek V4 corta uso de memória e FLOPs em IA

Modelo DeepSeek V4 usa 27% dos FLOPs e 10% do cache KV, ampliando contexto e reduzindo custos de hardware.

Romário Leite · 29 de abril de 2026

01

Redução drástica de recursos

DeepSeek V4 consome apenas 27% dos FLOPs por token e 10% do cache de chave‑valor, comparado ao V3.2.

02

Janela de contexto ampliada

Com janela de um milhão de tokens, o modelo processa mais texto antes de liberar memória, facilitando a fase Decode.

03

Como funciona o Decode

Na etapa Decode, o modelo guarda o contexto da fase Prefill, exigindo mais memória por causa do cache KV.

04

Compromisso entre compressão e precisão

Menor uso de cache pode gerar perda de detalhes, conhecido como efeito "agulha no palheiro", afetando a exatidão das respostas.

05

Impacto no hardware

Reduzir o cache KV alivia a pressão sobre DRAM e HBM, ajudando a conter a escassez e o aumento de preços de memória.

06

Arquitetura Multi‑Head Latent Attention

MLA comprime chaves e valores em uma representação menor, expandindo-os só na hora do cálculo, o que corta o consumo de memória.

Leia a matéria completa

Modelo DeepSeek V4 usa 27% dos FLOPs e 10% do cache KV, ampliando contexto e reduzindo custos de hardware.

Abrir matéria completa

TecFoco

Abrir matéria completa