← Todas as notícias

Inteligência Artificial

Real-SWE: benchmark novo testa IA em código enterprise de verdade

A WithSpecific lançou o Real-SWE, benchmark que avalia modelos de IA em codebases privadas, reais e de uso corporativo. O objetivo: medir desempenho onde o dinheiro é de verdade.

14 de set. de 20263 minFonte: WithSpecific
Engenheiro de software analisando código enterprise em monitor amplo, gráficos de barras em tela secundária

A WithSpecific lançou o Real-SWE, um benchmark que avalia modelos de IA em codebases privadas, reais e de uso corporativo — em vez dos repositórios públicos usados nos testes tradicionais. No Hacker News, a estreia rendeu 270 pontos e debate intenso.

O problema que o Real-SWE ataca é conhecido de quem trabalha com engenharia assistida por IA: benchmarks públicos (SWE-bench e afins) medem tarefas de repositórios open source, que os modelos já viram durante o treinamento. O desempenho ali não reflete o que acontece num sistema legado corporativo, cheio de contexto interno e padrões próprios.

Por que importa

  • Codebase privada testa memória de contexto e capacidade de navegar código desconhecido, não decoreba.
  • Empresas ganham um parâmetro mais honesto para escolher modelos para engenharia interna.
  • O benchmark sinaliza para provedores: o mercado corporativo quer resultado em código real, não em leaderboard.

Para quem contrata IA para desenvolvimento, a leitura prática é simples: antes de escolher modelo ou ferramenta, teste no seu próprio repositório. Um piloto com uma tarefa real da sua codebase vale mais do que qualquer ranking. Esse é um dos primeiros passos que recomendamos em projetos de consultoria de IA.

Fonte: WithSpecific.

Compartilhe

Achou útil? Mande pra quem precisa ver.

Quer aplicar isso no seu negócio?

Agende um diagnóstico de 30 minutos. Sem pitch, sem proposta empurrada — só entender se faz sentido continuar.