Um teste de escrita criativa da Vulsar AI comparou 24 modelos de linguagem com escritores amadores e profissionais, a partir de 475 pedidos de texto.
A avaliação chega em meio a discussões sobre a substituição de profissionais da escrita por modelos de inteligência artificial com maior capacidade.
No teste, apenas os modelos mais avançados conseguiram superar os escritores amadores, e por uma pequena diferença. Os profissionais tiveram pontuações bem maiores em uma avaliação separada.
GPT 6 Astra fica pouco acima dos escritores amadores
O teste avaliou a produção de textos longos. Para estimar a preferência dos leitores, foi usado um modelo de recompensa, ajustado com dados sobre preferências humanas.
- Leia também: OpenAI vê risco de IA usar calor do processador para se comunicar entre computadores sem internet
Esse sistema prevê qual texto teria mais chances de ser escolhido pelo leitor. Portanto, os percentuais representam taxas estimadas de vitória nessa comparação.
Na classificação geral, o GPT 6 Astra ficou em primeiro lugar, com 87,8%. Os escritores amadores vieram logo depois, com 86,6%. A pequena vantagem da IA sobre os amadores não se repetiu na comparação com os profissionais.
Quando avaliados separadamente, eles tiveram notas bem superiores, com uma grande diferença de habilidade entre os dois grupos de escritores.
O GPT 5.6 Sol, da OpenAI, ficou em terceiro lugar, com 77,6%. Já o Claude Fable 5.1, da Anthropic, alcançou 70,3%.

Modelos menores têm pontuações bem abaixo dos líderes
As notas caem bastante fora do grupo de modelos com trilhões de parâmetros, os valores internos usados pela IA para gerar suas respostas.
Claude Opus 5, Kimi K3, Grok 4.6 e outros ficaram na faixa de 50% a 65%. As pontuações mostram limitações mesmo entre modelos conhecidos quando comparados à escrita humana.
Entre os modelos menores, o desempenho foi ainda mais baixo. O Qwen3.8-27B chegou a 23,2%, enquanto o DeepSeek V4.1 Flash registrou 19,8%. O Gemma 4 26B ficou na última posição, com 10,9%.

Coerência em textos longos ainda separa humanos e IA
Os escritores humanos também produziram mais texto por pedido: 2.592 tokens, unidades que representam palavras ou partes delas. O Claude Fable 5.1 registrou 2.114 tokens, e o GPT 6 Astra, 1.537.
Uma discussão no Reddit aponta uma limitação dos modelos menores: eles tendem a perder a coerência em pedidos que envolvem vários capítulos e a repetir frases.
Essa dificuldade ajuda a explicar por que os escritores humanos são considerados superiores nesse aspecto. Eles conseguem manter histórias complexas e adaptar o estilo e o volume de escrita durante a produção.

A capacidade de pensar de forma espontânea também contribui para esses ajustes. Quanto tempo falta para os modelos reproduzirem o trabalho de escritores profissionais ainda é uma questão para outra discussão.








