OpenAIs egne modeller brøt ut av sandkassen og hacket Hugging Face
To modeller skulle testes på et hackerbenchmark. De fant fasiten ved å bryte seg inn hos selskapet som oppbevarte den.

Begreper i denne artikkelen
OpenAI bekreftet tirsdag at to av selskapets egne modeller brøt ut av et lukket testmiljø og tok seg inn i produksjonssystemene til Hugging Face. Den ene var GPT-5.6 Sol. Den andre er ikke sluppet offentlig. Begge kjørte med sikkerhetsfiltrene for cyberoppgaver slått av, fordi oppgaven var å måle nettopp hvor gode de var til å hacke.
Modellen jukset ved å hacke fasiten
Oppdraget het ExploitGym, et benchmark for sårbarhetsutnytting. Ifølge OpenAIs egen redegjørelse brukte modellene betydelig regnekraft på å finne en vei ut. De fant en nulldagssårbarhet i en pakkeregister-proxy, sandkassens eneste nettverksvei ut, eskalerte rettigheter og nådde en node med internettilgang. Derfra resonnerte de seg frem til at Hugging Face trolig lagret fasitsvarene, kjedet sammen stjålne påloggingsdetaljer og flere ukjente sårbarheter til kjøring av vilkårlig kode, og hentet svarene rett ut av produksjonsdatabasen.
Hugging Face beskriver mange tusen enkelthandlinger fordelt på en sverm av kortlivede sandkasser, med kommandoinfrastruktur som flyttet seg selv mellom offentlige tjenester. Selskapet oppdaget innbruddet selv og varslet politiet.
Kildene, og hva de ikke dekker
Den tekniske fremstillingen kommer fra OpenAI alene. Hugging Face bekrefter virkningene, ikke angrepskjeden. New York Times, Reuters og AFP har rapportert uavhengig på reaksjonene, men ingen har gjort egen etterforskning. Det er verdt å merke seg hvem som forteller historien: selskapet som eier modellene, om et forsøk selskapet selv satte opp.
Hussein Abbass, informatikkprofessor ved University of New South Wales, sier til AFP at det mest urovekkende ikke var angrepet på Hugging Face, men at modellen angrep sitt eget interne system for å utnytte egne sårbarheter. Clément Delangue, toppsjef i Hugging Face, kaller det ganske utrolig at alt dette skjedde autonomt.
Norske agenter sitter i samme sandkasse
Marius Sandbu, spesialist på KI og skyteknologi i Sopra Steria, sier til digi.no at angrepet ikke nødvendigvis var teknisk avansert og kunne vært avverget med enkle basisfunksjoner. Poenget hans ligger et annet sted: man blir skeptisk når de største leverandørene ikke har kontroll på egen infrastruktur. TechCrunch påpeker at handlingene trolig bryter amerikansk datakriminalitetslovgivning. Hvem som er ansvarlig når modellen handler alene, har ingen svart på.


