← Todas as notícias

Inteligência Artificial

DeepSeek V4 Pro resolve 96,4% do SWE-bench a $0,10 por teste

Medição independente da Vals AI aponta o melhor custo por problema já registrado no leaderboard. O modelo MIT continua imbatível em custo-benefício mesmo após o reajuste de preço.

04 de set. de 20263 minFonte: Vals AI
Mesa com dois monitores exibindo dashboards abstratos de testes e uma moeda simbolizando custo mínimo

O resultado independente mais impressionante da semana veio da Vals AI: rodando o DeepSeek V4 Pro (build 0813) em um harness minimalista do Mini-SWE-agent, o modelo resolveu 96,4% do SWE-bench Verified a $0,10 por teste. Nenhum modelo medido no leaderboard chegou perto desse custo por problema resolvido.

O contexto importa: o DeepSeek reajustou os preços no fim de agosto, e a Reuters chegou a reportar altas de até 14x sobre a era V3.2. Ainda assim, a tabela segue em $1,32/$3,96 por milhão de tokens, com custo de $0,27 por tarefa concluída. O modelo é MIT, o que elimina qualquer dor de cabeça de licença comercial.

Onde o pé bate

  • Lentidão: cerca de 38 tokens/s na API oficial, dos mais lentos da categoria.
  • Cache hit custa 20% do preço, combinação boa para código repetitivo.
  • O irmão V4 Flash resolve 79% do SWE-bench a $0,11 por tarefa.
  • A variante Flash Vision experimental chega perto do Opus 4.8 em agentes visuais.

A conclusão do relatório semanal de modelos é direta: para 80% do trabalho de código rotineiro, modelos assim entregam qualidade de fronteira por uma fração do preço dos fechados. Interatividade pesada ainda sofre com a velocidade, mas batch e agentes assíncronos são território natural do DeepSeek.

Fonte: Vals AI SWE-bench. Veja também o baseline de GEO do site.

Compartilhe

Achou útil? Mande pra quem precisa ver.

Quer aplicar isso no seu negócio?

Agende um diagnóstico de 30 minutos. Sem pitch, sem proposta empurrada — só entender se faz sentido continuar.