Hva SWE-bench egentlig måler, og hvorfor alle skryter av samme tall
Alle toppmodeller oppgir en SWE-bench-score. Men Verified, Full og Pro måler ulike ting, og det høyeste tallet er det minst pålitelige.
Når et AI-selskap lanserer en kodemodell, kommer det nesten alltid med ett tall: SWE-bench. Modellen får en ekte feilrapport fra et GitHub-prosjekt og hele kodebasen, og må levere en rettelse som består prosjektets skjulte tester. Det høres objektivt ut. Det er mer komplisert.
| Variant | Oppgaver | Egenskaper | |
|---|---|---|---|
| Verified | 500 | Kun Python, menneskefiltrert | |
| Full | ~2 294 | Ufiltrert | |
| Pro | 1 865 | 41 repoer, flere språk, laget for å motstå kontaminering |
Tre benchmarks, tre tall
Verified er et menneskefiltrert utvalg på 500 oppgaver, kun Python, laget for å være løsbart og tydelig. Full er det opprinnelige, større settet på rundt 2 294 oppgaver, mer støyete og med noen uløselige. Pro er den nyeste og hardeste varianten: 1 865 oppgaver fra 41 repoer på flere språk, bygget for å motstå kontaminering.
Hvorfor det høyeste tallet lyver mest
På Verified ligger toppmodellene høyt, rundt 87 prosent for Claude Opus 4.7. Men oppgavene er eldre enn modellene og ligger sannsynligvis i treningsdataene. Da måler man like mye hukommelse som problemløsning. På Pro faller de samme modellene til mellom 45 og 65 prosent. OpenAI sluttet å rapportere Verified i februar 2026, nettopp på grunn av kontaminering.
Hva du bør se etter
Når en leverandør oppgir et SWE-bench-tall, er første spørsmål hvilken variant. Verified er smigrende og kontaminerings-utsatt. Pro er hardere og mer ærlig. Avstanden mellom de to er det egentlige signalet om hvor god modellen er på ukjent kode.
Neste gang en modell skryter av 90 prosent på SWE-bench, er det første spørsmålet ikke hvor høyt, men hvilken.


