Inteligência Artificial
Real-SWE: benchmark novo testa IA em código enterprise de verdade
A WithSpecific lançou o Real-SWE, benchmark que avalia modelos de IA em codebases privadas, reais e de uso corporativo. O objetivo: medir desempenho onde o dinheiro é de verdade.

A WithSpecific lançou o Real-SWE, um benchmark que avalia modelos de IA em codebases privadas, reais e de uso corporativo — em vez dos repositórios públicos usados nos testes tradicionais. No Hacker News, a estreia rendeu 270 pontos e debate intenso.
O problema que o Real-SWE ataca é conhecido de quem trabalha com engenharia assistida por IA: benchmarks públicos (SWE-bench e afins) medem tarefas de repositórios open source, que os modelos já viram durante o treinamento. O desempenho ali não reflete o que acontece num sistema legado corporativo, cheio de contexto interno e padrões próprios.
Por que importa
- Codebase privada testa memória de contexto e capacidade de navegar código desconhecido, não decoreba.
- Empresas ganham um parâmetro mais honesto para escolher modelos para engenharia interna.
- O benchmark sinaliza para provedores: o mercado corporativo quer resultado em código real, não em leaderboard.
Para quem contrata IA para desenvolvimento, a leitura prática é simples: antes de escolher modelo ou ferramenta, teste no seu próprio repositório. Um piloto com uma tarefa real da sua codebase vale mais do que qualquer ranking. Esse é um dos primeiros passos que recomendamos em projetos de consultoria de IA.
Fonte: WithSpecific.