Hopp til innhold
Skreddersy nyhetsbrev →
Skreddersy nyhetsbrev →
Avisen AI
28. JULI 2026

PersonvernVilkår
© 2026 Avisen AI
Modeller·6. mai 2026·1 min lesing

Hva SWE-bench egentlig måler, og hvorfor alle skryter av samme tall

Alle toppmodeller oppgir en SWE-bench-score. Men Verified, Full og Pro måler ulike ting, og det høyeste tallet er det minst pålitelige.

Av Redaksjonen
SWE-bench-logoen med en tegnet lama-maskot bak en laptop
Illustrasjon: SWE-bench

Begreper i denne artikkelen

BenchmarkStandardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.
LLMLarge Language Model — AI trent på store mengder tekst for å forstå og generere språk. GPT-5 og Claude er eksempler.

Når et AI-selskap lanserer en kodemodell, kommer det nesten alltid med ett tall: SWE-bench. Modellen får en ekte feilrapport fra et GitHub-prosjekt og hele kodebasen, og må levere en rettelse som består prosjektets skjulte tester. Det høres objektivt ut. Det er mer komplisert.

VariantOppgaverEgenskaper
Verified500Kun Python, menneskefiltrert
Full~2 294Ufiltrert
Pro1 86541 repoer, flere språk, laget for å motstå kontaminering

Tre benchmarks, tre tall

Verified er et menneskefiltrert utvalg på 500 oppgaver, kun Python, laget for å være løsbart og tydelig. Full er det opprinnelige, større settet på rundt 2 294 oppgaver, mer støyete og med noen uløselige. Pro er den nyeste og hardeste varianten: 1 865 oppgaver fra 41 repoer på flere språk, bygget for å motstå kontaminering.

Hvorfor det høyeste tallet lyver mest

På Verified ligger toppmodellene høyt, rundt 87 prosent for Claude Opus 4.7. Men oppgavene er eldre enn modellene og ligger sannsynligvis i treningsdataene. Da måler man like mye hukommelse som problemløsning. På Pro faller de samme modellene til mellom 45 og 65 prosent. OpenAI sluttet å rapportere Verified i februar 2026, nettopp på grunn av kontaminering.

Hva du bør se etter

Når en leverandør oppgir et SWE-bench-tall, er første spørsmål hvilken variant. Verified er smigrende og kontaminerings-utsatt. Pro er hardere og mer ærlig. Avstanden mellom de to er det egentlige signalet om hvor god modellen er på ukjent kode.

Neste gang en modell skryter av 90 prosent på SWE-bench, er det første spørsmålet ikke hvor høyt, men hvilken.


Kilder

  1. github.com
  2. epoch.ai
  3. venturebeat.com

Relaterte artikler

Claude Opus 5: halve prisen av Fable 5, nesten samme resultat
Modeller

Claude Opus 5: halve prisen av Fable 5, nesten samme resultat

24. juli 2026
Qwen3.8-Max: Alibabas svar på Kimi K3 kom på tre døgn
Modeller

Qwen3.8-Max: Alibabas svar på Kimi K3 kom på tre døgn

19. juli 2026
Kimi K3: verdens største åpne modell er ikke billig lenger
Modeller

Kimi K3: verdens største åpne modell er ikke billig lenger

16. juli 2026