Anthropics AI-forsker slo menneskene. Så forsvant resultatet i produksjon.
En automatisert alignment-forsker fra Anthropic nådde 0,97 der mennesker nådde 0,23. Haken: tallet holdt ikke da det møtte selskapets egen produksjonsmodell.
Begreper i denne artikkelen
Anthropic kjørte ni instanser av Claude Opus 4.6 som automatiserte alignment-forskere på et klassisk problem: kan en svak modell veilede treningen av en sterkere? Resultatet selskapet løftet fram: en PGR på 0,97, mot menneskers 0,23. Tallet er imponerende. Det er også Anthropics eget, og det generaliserte ikke.
Hva PGR er
PGR står for Performance Gap Recovered. Null betyr at modellen ikke gjør det bedre enn den svake læreren, én betyr at den matcher en sterk modell trent på fasiten. Anthropics automatiserte forskere nådde 0,97 på fem dager, til en kostnad på rundt 18 000 dollar og 800 forskningstimer.
Haken teksten ikke nevner
Eksperimentene ble kjørt på små åpne Qwen-modeller, på 0,5 og 4 milliarder parametere. Da Anthropic brukte den beste metoden på sin egen produksjonsmodell, Claude Sonnet 4, var effekten rundt et halvt poeng, statistisk uten betydning. Selskapet medgir selv at de automatiserte forskerne utnytter små sværheter som ikke overføres til større skala.
Ekte forskning eller posisjonering
Den uavhengige lesningen, blant annet fra The Decoder, løfter nettopp fram at resultatet falt sammen i produksjon. Det er legitimt å spørre om et selskap som forsker på sin egen teknologis risiko driver ekte sikkerhetsarbeid eller strategisk posisjonering, særlig når tallet kommer uker før en rekordstor kapitalrunde.
Et tall som glimrer i laben og forsvinner i produksjon, er ikke et gjennombrudd. Det er en påminnelse om hvor lett demonstrasjoner imponerer.


