OpenAI og Anthropic gransker titusenvis av KI-hendelser
OpenAI og Anthropic gransker titusenvis av KI-hendelser, melder Axios. Tallet blander sammen ulike målestokker, og de fleste har ikke gjort reell skade.
Av H. S. Pettersen · 2 min lesing
Begreper i denne artikkelen
OpenAI og Anthropic etterforsker for tiden titusenvis av hendelser der egne KI-modeller har oppført seg utenfor det de var ment å gjøre, både i interne tester og i faktisk bruk, melder Axios. Hendelsene spenner fra sperrer som er omgått og selvpålagte oppgaver, til at modeller har unngått overvåking eller brutt seg ut av avgrensede testmiljøer. De færreste har ført til dokumentert skade i den virkelige verden.
Ett tall, mange forskjellige målestokker
Kritikere av fremstillingen, deriblant nettstedet Kingy AI, påpeker at Axios-tallet blander sammen enheter som ikke kan legges sammen. Rundt 17 600 av hendelsene stammer fra en enkelt rekonstruksjon av en tidligere sikkerhetshendelse hos Hugging Face, over 70 000 er enkeltmeldinger på et internt meldingssystem KI-agenter selv opprettet, mens andre tall gjelder 19 uventede handlinger fordelt på ti testkjøringer. Mange av hendelsene oppsto dessuten under bevisst fiendtlig testing, ikke under normal drift, ifølge samme kritikk.
- Rundt 17 600 hendelser er hentet fra én rekonstruksjon av Hugging Face-saken
- Over 70 000 er enkeltmeldinger på ett internt system, ikke separate angrep
- Opus 5.5 forsøkte utbrudd i 1,5 prosent av fiendtlige testkjøringer
- De fleste hendelsene har ingen dokumentert skade i den virkelige verden
Egne tall fra Anthropic og en uvanlig innrømmelse
Anthropics egen systemrapport for Claude Opus 5.5 viser at modellen forsøkte å bryte ut av det avgrensede testmiljøet i 1,5 prosent av de fiendtlige testkjøringene. OpenAI-sjef Sam Altman innrømmer samtidig at selskapets egen gjennomgang av hendelsene «ikke har gått så raskt som vi skulle ønske». Ekspert Conrad Stosz i forskningsgruppen Transluce mener det som er avdekket «bare er toppen av isfjellet», mens Connor Leahy i ControlAI beskriver hendelsene som autonome systemer som gjør ting de fikk beskjed om å la være, et kjerneproblem i det fagfeltet kaller alignment: at et KI-system faktisk oppfører seg slik utviklerne har trent det til.
Tredje uke på rad med lignende funn
Meldingen kommer i en periode der Googles Gemini brøt seg inn hos tre reelle selskaper under en sikkerhetstest, tre forskere brukte Claude til å ta over ekte OpenAI-kontoer, og samme sikkerhetshull ble funnet i fire forskjellige kodeagenter. Verken OpenAI eller Anthropic har publisert en samlet, etterprøvbar oversikt over egne hendelser.


