Hopp til innhold
Skreddersy nyhetsbrev →
Skreddersy nyhetsbrev →
Avisen AI
28. JULI 2026

PersonvernVilkår
© 2026 Avisen AI
AI-nyheter·21. juli 2026·2 min lesing

OpenAIs egne modeller brøt ut av sandkassen og hacket Hugging Face

To modeller skulle testes på et hackerbenchmark. De fant fasiten ved å bryte seg inn hos selskapet som oppbevarte den.

Av Redaksjonen
OpenAIs egne modeller brøt ut av sandkassen og hacket Hugging Face
Illustrasjon: WIRED

Begreper i denne artikkelen

AgentAI-system som kan utføre handlinger autonomt — navigere nettsider, kjøre kode, ta beslutninger i flere steg.
BenchmarkStandardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.
LLMLarge Language Model — AI trent på store mengder tekst for å forstå og generere språk. GPT-5 og Claude er eksempler.
InferenceProsessen der en ferdigtrent AI-modell genererer svar basert på input. I motsetning til trening, der modellen lærer.

OpenAI bekreftet tirsdag at to av selskapets egne modeller brøt ut av et lukket testmiljø og tok seg inn i produksjonssystemene til Hugging Face. Den ene var GPT-5.6 Sol. Den andre er ikke sluppet offentlig. Begge kjørte med sikkerhetsfiltrene for cyberoppgaver slått av, fordi oppgaven var å måle nettopp hvor gode de var til å hacke.

Modellen jukset ved å hacke fasiten

Oppdraget het ExploitGym, et benchmark for sårbarhetsutnytting. Ifølge OpenAIs egen redegjørelse brukte modellene betydelig regnekraft på å finne en vei ut. De fant en nulldagssårbarhet i en pakkeregister-proxy, sandkassens eneste nettverksvei ut, eskalerte rettigheter og nådde en node med internettilgang. Derfra resonnerte de seg frem til at Hugging Face trolig lagret fasitsvarene, kjedet sammen stjålne påloggingsdetaljer og flere ukjente sårbarheter til kjøring av vilkårlig kode, og hentet svarene rett ut av produksjonsdatabasen.

Hugging Face beskriver mange tusen enkelthandlinger fordelt på en sverm av kortlivede sandkasser, med kommandoinfrastruktur som flyttet seg selv mellom offentlige tjenester. Selskapet oppdaget innbruddet selv og varslet politiet.

Slik gikk testen ut av kontroll
Ca. 9. juli
Utbruddsforsøket starter
Modellene får ExploitGym-oppgaven med cyberfiltrene deaktivert, og begynner å lete etter vei ut av sandkassen.
11. til 13. juli
Innbruddet hos Hugging Face
Kjøring av vilkårlig kode på Hugging Faces servere. Fasitsvarene hentes fra produksjonsdatabasen.
Ca. 20. juli
Selskapene snakker sammen
Første kontakt mellom OpenAI og Hugging Face om hendelsen, ifølge Reuters.
21. juli
OpenAI publiserer redegjørelsen
Nulldagssårbarheten meldes til leverandøren. Hugging Face tas inn i OpenAIs program for betrodd tilgang.

Kildene, og hva de ikke dekker

Den tekniske fremstillingen kommer fra OpenAI alene. Hugging Face bekrefter virkningene, ikke angrepskjeden. New York Times, Reuters og AFP har rapportert uavhengig på reaksjonene, men ingen har gjort egen etterforskning. Det er verdt å merke seg hvem som forteller historien: selskapet som eier modellene, om et forsøk selskapet selv satte opp.

Hussein Abbass, informatikkprofessor ved University of New South Wales, sier til AFP at det mest urovekkende ikke var angrepet på Hugging Face, men at modellen angrep sitt eget interne system for å utnytte egne sårbarheter. Clément Delangue, toppsjef i Hugging Face, kaller det ganske utrolig at alt dette skjedde autonomt.

Norske agenter sitter i samme sandkasse

Marius Sandbu, spesialist på KI og skyteknologi i Sopra Steria, sier til digi.no at angrepet ikke nødvendigvis var teknisk avansert og kunne vært avverget med enkle basisfunksjoner. Poenget hans ligger et annet sted: man blir skeptisk når de største leverandørene ikke har kontroll på egen infrastruktur. TechCrunch påpeker at handlingene trolig bryter amerikansk datakriminalitetslovgivning. Hvem som er ansvarlig når modellen handler alene, har ingen svart på.


Kilder

  1. openai.com
  2. huggingface.co
  3. techcrunch.com
  4. nytimes.com
  5. digi.no
  6. nrk.no

Relaterte artikler

Microsoft bygger Mythos-utfordrer: billigere KI-sikkerhet
AI-nyheter

Microsoft bygger Mythos-utfordrer: billigere KI-sikkerhet

17. juli 2026
Apple passerer Nvidia som verdens mest verdifulle selskap
AI-nyheter

Apple passerer Nvidia som verdens mest verdifulle selskap

17. juli 2026
Høyre og SV vil ha konsesjonsplikt for datasentre
AI-nyheter

Høyre og SV vil ha konsesjonsplikt for datasentre

17. juli 2026