Inteligência Artificial
DeepSeek V4 Pro resolve 96,4% do SWE-bench a $0,10 por teste
Medição independente da Vals AI aponta o melhor custo por problema já registrado no leaderboard. O modelo MIT continua imbatível em custo-benefício mesmo após o reajuste de preço.

O resultado independente mais impressionante da semana veio da Vals AI: rodando o DeepSeek V4 Pro (build 0813) em um harness minimalista do Mini-SWE-agent, o modelo resolveu 96,4% do SWE-bench Verified a $0,10 por teste. Nenhum modelo medido no leaderboard chegou perto desse custo por problema resolvido.
O contexto importa: o DeepSeek reajustou os preços no fim de agosto, e a Reuters chegou a reportar altas de até 14x sobre a era V3.2. Ainda assim, a tabela segue em $1,32/$3,96 por milhão de tokens, com custo de $0,27 por tarefa concluída. O modelo é MIT, o que elimina qualquer dor de cabeça de licença comercial.
Onde o pé bate
- Lentidão: cerca de 38 tokens/s na API oficial, dos mais lentos da categoria.
- Cache hit custa 20% do preço, combinação boa para código repetitivo.
- O irmão V4 Flash resolve 79% do SWE-bench a $0,11 por tarefa.
- A variante Flash Vision experimental chega perto do Opus 4.8 em agentes visuais.
A conclusão do relatório semanal de modelos é direta: para 80% do trabalho de código rotineiro, modelos assim entregam qualidade de fronteira por uma fração do preço dos fechados. Interatividade pesada ainda sofre com a velocidade, mas batch e agentes assíncronos são território natural do DeepSeek.
Fonte: Vals AI SWE-bench. Veja também o baseline de GEO do site.