10. SEPTEMBER 2026

Modeller·6. mai 2026

Hva SWE-bench egentlig måler, og hvorfor alle skryter av samme tall

Alle toppmodeller oppgir en SWE-bench-score. Men Verified, Full og Pro måler ulike ting, og det høyeste tallet er det minst pålitelige.

Av H. S. Pettersen · 1 min lesing
SWE-bench-logoen med en tegnet lama-maskot bak en laptop
Illustrasjon: SWE-bench

Begreper i denne artikkelen

BenchmarkStandardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.
LLMLarge Language Model — AI trent på store mengder tekst for å forstå og generere språk. GPT-5 og Claude er eksempler.

Når et AI-selskap lanserer en kodemodell, kommer det nesten alltid med ett tall: SWE-bench. Modellen får en ekte feilrapport fra et GitHub-prosjekt og hele kodebasen, og må levere en rettelse som består prosjektets skjulte tester. Det høres objektivt ut. Det er mer komplisert.

VariantOppgaverEgenskaper
Verified500Kun Python, menneskefiltrert
Full~2 294Ufiltrert
Pro1 86541 repoer, flere språk, laget for å motstå kontaminering

Tre benchmarks, tre tall

Verified er et menneskefiltrert utvalg på 500 oppgaver, kun Python, laget for å være løsbart og tydelig. Full er det opprinnelige, større settet på rundt 2 294 oppgaver, mer støyete og med noen uløselige. Pro er den nyeste og hardeste varianten: 1 865 oppgaver fra 41 repoer på flere språk, bygget for å motstå kontaminering.

Hvorfor det høyeste tallet lyver mest

På Verified ligger toppmodellene høyt, rundt 87 prosent for Claude Opus 4.7. Men oppgavene er eldre enn modellene og ligger sannsynligvis i treningsdataene. Da måler man like mye hukommelse som problemløsning. På Pro faller de samme modellene til mellom 45 og 65 prosent. OpenAI sluttet å rapportere Verified i februar 2026, nettopp på grunn av kontaminering.

Hva du bør se etter

Når en leverandør oppgir et SWE-bench-tall, er første spørsmål hvilken variant. Verified er smigrende og kontaminerings-utsatt. Pro er hardere og mer ærlig. Avstanden mellom de to er det egentlige signalet om hvor god modellen er på ukjent kode.

Neste gang en modell skryter av 90 prosent på SWE-bench, er det første spørsmålet ikke hvor høyt, men hvilken.