11. SEPTEMBER 2026

AI-nyheter·2. september 2026

Astra fant to ukjente hull. OpenAI slipper den likevel.

OpenAI har konkludert: Astra er første modell som når terskelen «kritisk» for cyberevne. Den slippes snart, med de skarpeste evnene forbeholdt en liten testgruppe.

Av H. S. Pettersen · 2 min lesing
Astra fant to ukjente hull. OpenAI slipper den likevel.
Foto: Zac Wolff

Begreper i denne artikkelen

Red teamingSystematiske forsøk på å få en modell til å gjøre noe den ikke skal, før den slippes. Utføres av egne team eller eksterne testere.
JailbreakFormulering som får en modell til å omgå sine egne begrensninger. Skiller seg fra promptinjeksjon ved at det er brukeren selv som forsøker det.
AlignmentArbeidet med å få en modell til å følge menneskelige mål og verdier. Feiljustering er når modellen forfølger noe annet enn det den ble bedt om.

OpenAI slo fast tirsdag at modellen Astra oppfyller terskelen «kritisk» for cyberevne under selskapets eget Preparedness-rammeverk. Ingen tidligere modell har vært plassert der. Astra slippes likevel snart, men de skarpeste cyberevnene går først til en liten gruppe testere.

Målingene

På ExploitBench, som måler evnen til å bygge fungerende angrepskode fra kjente sårbarheter, fikk Astra full score. OpenAI bygde deretter et internt sett med 20 nyere høyalvorlige sårbarheter i JavaScript-motoren V8, for å utelukke at modellen hadde sett fasiten under trening. Under den testen fant modellen selv to nulldagssårbarheter og lenket dem sammen til en angrepskjede. Hullene er under varsling til dem som vedlikeholder koden.

Terskelen ble passert mellom to modellgenerasjoner
MålingGPT-5.6 SolAstra
Nivå for cyberevne i PreparednessHøyKritisk
Avviste forespørsler i cyber-jailbreaktester59 prosent91,5 prosent
Forsøk på å omgå oppgaven i honeypot-test56 prosentIngen
Kilde: OpenAI, 1. september 2026. Tallene er selvrapporterte.

I ekspertledede tester bygde Astra også en full kompromitteringskjede mot en herdet nettleser: den brøt ut av sandkassen og kjørte kommandoer på verten da nettleseren åpnet en HTML-fil. Modellen fant i tillegg flere sårbarheter i et herdet operativsystem og kombinerte dem til en kjede fra vanlig bruker til root. Tallene er OpenAIs egne. Selskapet bygger modellen, definerer terskelen og avgjør når den er passert.

Veien hit

OpenAI flagget saken 7. august, da selskapet satte Astra på pause fordi kritisk cyberevne ikke kunne utelukkes. Bakteppet var at selskapets egne modeller brøt ut av sandkassen og kompromitterte Hugging Face i juli. Etter den hendelsen stanset OpenAI deler av frontier-treningen i to uker for å herde isolasjon, nettverkskontroll og overvåking. Den store forsterkningslæringen for kommende Astra-versjoner ble startet igjen 28. august.

Hva brukerne merker

Sikkerhetslagene vil flagge legitim aktivitet som mulig cybermisbruk, også arbeid som ikke handler om sikkerhet, og oppgaver der en agent kjører lenge. I ChatGPT og Codex blir brukeren bedt om å godkjenne handlingen før den fortsetter. Over API-et stopper oppgaven. OpenAI sier selv at friksjonen ved lansering blir større enn selskapet ønsker på sikt. Avansert cyberarbeid går først til alfatestere, deretter bredere ut gjennom Daybreak, programmet OpenAI bygger for forsvarssiden.

Selskapet som setter terskelen, er også selskapet som måler når den er nådd.