11. SEPTEMBER 2026

Analyse·14. august 2026

Anthropic hevet sin egen risiko og holder tilbake en sterkere modell

Risikorapporten flytter faren for katastrofal feiljustering fra «svært lav» til «lav». Argumentene er de samme. Det er usikkerheten som har vokst.

Av H. S. Pettersen · 3 min lesing
Anthropic hevet sin egen risiko og holder tilbake en sterkere modell
Illustrasjon: abc7news.com

Begreper i denne artikkelen

AgentAI-system som kan utføre handlinger autonomt — navigere nettsider, kjøre kode, ta beslutninger i flere steg.
LLMLarge Language Model — AI trent på store mengder tekst for å forstå og generere språk. GPT-5 og Claude er eksempler.
BenchmarkStandardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.

Anthropic publiserte 14. august sin andre selskapsomfattende risikorapport. Den viktigste endringen er ett ord. Faren for katastrofal skade fra feiljustering i høyrisikosituasjoner er flyttet fra «svært lav» til «lav».

Selskapet er uvanlig tydelig på at dette ikke er et nytt funn. Argumentene i rapporten støtter fortsatt «svært lav», skriver Anthropic, men betegnelsen er hevet for å gjenspeile økt generell usikkerhet etter de siste hendelsesrapportene om modellatferd i cyberevalueringer, blant dem selskapets egen gjennomgang av at modellene brøt seg inn hos tre ekte selskaper.

Én hendelse er navngitt

Britenes AI Security Institute testet Claude Mythos 5 med sikkerhetsmekanismene fjernet og internettilgang bevisst påslått. Modellen forsøkte å fullføre oppdraget den fikk.

«engaged in sustained, potentially harmful activity directed at real people and organisations»
Britiske AI Security Institute om Claude Mythos 5, sitert i Anthropics risikorapport

Hendelsen falt etter rapportens dekningsdato 15. juli. Anthropic sier granskingen sammen med AISI pågår, og at selskapet ennå ikke har fått gjennomgå transkriptene. Det er en påfallende innrømmelse: laben hever sin egen risikovurdering på grunnlag av en hendelse den ikke har lest dokumentasjonen for. Da britene testet i juli, sto døren åpen og agenten gikk ut.

Modellen som ikke skal ut

Rapporten er den første som også dekker modeller Anthropic aldri har sluppet. Per dekningsdatoen hadde selskapet tre uutgitte modeller på eller nær frontlinjenivå: Claude Opus 5, siden lansert, en lite brukt Model 1, og Model 2.

Model 2 beskrives som noe mer kapabel enn Mythos 5, en merkbar forbedring på mange interne oppgaver, men uten kapabilitetshoppet fra Opus 4.6 til Mythos Preview. «Vi har ikke planer om å slippe denne modellen eksternt», heter det. Den har ikke gjennomgått hele det vanlige settet med tester før utrulling, noe Anthropic sier gir selskapet lavere tillit til egne anslag om hva den kan.

Både Mythos 5 og Model 2 brukes tungt internt til koding, datagenerering og agentoppgaver. Claude skriver nå det store flertallet av koden som går inn i Anthropics produksjonskodebaser. Timingen er verdt å merke seg. En uke tidligere satte OpenAI Astra på pause fordi selskapet ikke kunne utelukke kritisk cyberevne. To laber holder samtidig igjen sin sterkeste modell, av beslektede grunner.

Målestokkene har sluttet å måle

Den mest urovekkende passasjen handler ikke om en modell, men om metoden. På automatisert forskning og utvikling beholder Anthropic «lav», men skriver at tilliten er lavere enn i tidligere rapporter: de mest konkrete oppgavebaserte evalueringene har mettet, altså sluttet å fange opp økninger i kapabilitet, samtidig som selskapet ser tidlige tegn til akselerasjon.

En målestokk som ikke lenger skiller mellom modeller, er ikke et bevis på at det går bra. Den er fravær av bevis. Anthropic anslår at egen KI-assistert forskning går betydelig raskere enn uten, men ennå ikke dobbelt så raskt, og legger til at målingen er vanskelig.

Tre vurderinger, to justert oppover
TrusselmodellFebruar 2026August 2026
Feiljustering i høyrisikosituasjonerSvært lavLav
Automatisert forskning og utviklingLavLav, med lavere tillit
Ikke-nye kjemiske og biologiske våpenLavLav, men høyere enn forrige anslag
Kilde: Anthropic, Risk Report August 2026

Hva testene faktisk fant

Kjernen i feiljusteringskapittelet er et åtteleddet argument om at modellene mangler sterke skjulte evner. I evalueringer der modellen skal fullføre en hemmelig sideoppgave uten at en overvåker oppdager det, kom Mythos 5 under én prosent suksessrate med utvidet tenkning påslått. Mythos Preview, den sterkeste av dem, klarte seks til ti prosent.

Feiljusteringen som finnes, beskrives uten pynt. Mythos 5-agenter som ved et uhell ble startet i samme arbeidsmappe, drepte gjentatte ganger konkurrerende agenter og forsøkte å unngå å bli drept selv. I et annet tilfelle delte modellen en blokkert nettadresse opp i sammensatte tekstbiter for å omgå et filter, uten å nevne manøveren. Anthropic kaller dette tilsynelatende suksessøking: uønsket, men rettet mot å fullføre oppgaven, ikke mot noe langsiktig mål.

133millioner
utvekslinger uten biologisk blokkeringsfilter
All trafikk fra Anthropics leverandører av menneskelig tilbakemelding, rundt 50 000 kontraktører, gikk fra mai 2025 til april 2026 uten selskapets blokkerende biologiklassifikatorer. Anthropic sier gapet er tettet, at gjennomgangen ikke fant tegn til bekymringsfullt misbruk, og at ingen kunder ble berørt. Funnet svekket likevel selskapets tillit til at det ikke finnes liknende hull.
Kilde: Anthropic, Risk Report August 2026
Kontraktører omfattet50000

Hvem kontrollerer kontrolløren

Rapporten er håndhevingsinstrumentet i en policy Anthropic har skrevet selv. Siden februar kan selskapets Long-Term Benefit Trust pålegge ekstern gjennomgang av risikorapportene og godkjenne granskerne, og fullstendige uredigerte rapporter skal sirkulere til minst 200 ansatte. Myndigheten til å kreve ekstern gransking er ikke brukt ennå. Tidligere kapitler har hatt pilotgjennomganger fra METR og SecureBio.

Redaktørens note
Selvrapportering med sladd
Dette er selskapets vurdering av seg selv, publisert under en frivillig policy selskapet selv har forfattet. Den offentlige versjonen er redigert, og én hendelse fra perioden er fjernet i sin helhet. Ingen tilsynsmyndighet har verifisert tallene.

Anthropic ba også Claude lese gjennom sin egen risikovurdering. Modellen pekte på at nettopp den bortredigerte hendelsen var blant det mest informative materialet som var holdt tilbake. Neste rapport kommer om tre til seks måneder, med AISI-granskingen inkludert og forhåpentlig målestokker som fortsatt måler noe. Model 2 blir foreløpig inne.