Qual IA escreve melhor quando a missão é parecer gente?
Um artigo sobre como testar modelos de escrita sem cair no placar bonito que não diz nada sobre voz, ritmo e revisão.
"Texto bom não parece que venceu uma rubrica. Parece que alguém pensou antes de publicar."
O placar engana
Benchmark ajuda, mas não decide sozinho. Um modelo pode ir bem em teste geral e ainda escrever como manual de micro-ondas quando você pede um artigo com voz. Escrita boa depende de ritmo, opinião, corte e coragem de apagar frase bonita que não diz nada.
O teste certo usa material real. Pegue um tema, uma fonte e um objetivo. Peça versões para newsletter, post e roteiro curto. Depois compare retrabalho, não só a primeira resposta.
Sinais de texto com alma
Procure frases específicas. Procure pequenas opiniões. Procure variação de tamanho. Se tudo vier com introdução perfeita, três bullets e conclusão motivacional, o alerta toca igual Windows XP travando na lan house.
Também vale contar quantas frases poderiam estar em qualquer marca. Quanto mais genérico o texto, mais revisão humana ele vai pedir.
Como eu testaria
Eu daria a mesma fonte para três modelos e pediria uma abertura de artigo, uma legenda e um email. Depois revisaria sem olhar o nome do modelo. O vencedor seria o que mais economiza edição, não o que solta mais palavras.
No fim, modelo bom é o que deixa você mais perto do publicar. Se ele te entrega uma parede de texto para você limpar, ele só terceirizou a bagunça.
inscreva-se