Anthropic innrømmer: tre feil gjorde Claude Code dårligere i en måned
Lavere resonnering, en caching-bug og to linjer i system-prompten. En AMD-ingeniør telte 6 852 sesjoner før Anthropic forklarte hva som skjedde.

Begreper i denne artikkelen
Anthropic publiserte 23. april en ingeniør-postmortem som bekrefter at tre separate produktendringer — innført mellom 4. mars og 16. april — degraderte Claude Code for en betydelig andel brukere, ifølge Anthropics blogg og VentureBeat. Endringene rammet Claude Code, Claude Agent SDK og Claude Cowork. Alle tre er nå reversert per versjon 2.1.116.
Det er en uvanlig innrømmelse i en bransje der modellkvalitet sjelden diskuteres åpent — og den kom først etter at en ekstern ingeniør dokumenterte problemet kvantitativt.
De tre feilene
Feil 1 (4. mars): Anthropic senket standard resonneringsnivå fra «high» til «medium» for å redusere latens som fikk grensesnittet til å fryse. Konsekvensen: dårligere kodekvalitet på tvers av oppgaver. Reversert 7. april etter brukertilbakemeldinger, ifølge Fortune.
Feil 2 (26. mars): En caching-bug i tenkehistorikken. I stedet for å tømme tenkehistorikk én gang per sesjon, tømte den historikken etter hvert eneste steg — for resten av sesjonen. Brukere opplevde at Claude «glemte» kontekst, gjentok seg selv og tok merkelige verktøyvalg. Fikset 10. april, ifølge Anthropics postmortem.
Feil 3 (16. april): To linjer lagt til i system-prompten: «Keep text between tool calls to ≤25 words. Keep final responses to ≤100 words unless the task requires more detail.» Tiltenkt som anti-verbositet — men prompt engineering-endringen skadet kodekvaliteten med 3 prosent på en spesifikk eval som standard testsuiten aldri dekket. Reversert 20. april, ifølge The Register.
AMD-ingeniøren som telte
Stella Laurenzo, Senior Director i AMDs AI-gruppe, publiserte en uavhengig revisjon av 6 852 Claude Code-sesjonsfiler og over 234 000 verktøykall, ifølge Dev.to og SmartScope. Analysen dokumenterte konkret regresjon — og ga Anthropic datagrunnlaget de trengte for å identifisere årsakene.
Anthropic nullstilte bruksgrensene for alle abonnenter samme dag postmortemen ble publisert, ifølge Gigazine.
Hva det betyr
Tre lærdommer: For det første — LLM-kvalitet er ikke bare modellvekter. Produktlaget rundt modellen (resonneringsnivå, caching, system-prompt) kan degradere opplevelsen like mye som en dårligere modell. For det andre — brukere merker kvalitetsfall før selskapet gjør det. Anthropic oppdaget ikke problemene gjennom sine egne tester. For det tredje — transparens bygger tillit. Denne postmortemen er det mest detaljerte innblikket noen frontier-lab har gitt i hvordan produktendringer påvirker modellkvalitet.
Spørsmålet er om andre labs — OpenAI, Google — ville gjort det samme. Og svaret, basert på historikken, er at de ikke har gjort det ennå.


