Astra fant to ukjente hull. OpenAI slipper den likevel.
OpenAI har konkludert: Astra er første modell som når terskelen «kritisk» for cyberevne. Den slippes snart, med de skarpeste evnene forbeholdt en liten testgruppe.
Av H. S. Pettersen · 2 min lesing
Begreper i denne artikkelen
OpenAI slo fast tirsdag at modellen Astra oppfyller terskelen «kritisk» for cyberevne under selskapets eget Preparedness-rammeverk. Ingen tidligere modell har vært plassert der. Astra slippes likevel snart, men de skarpeste cyberevnene går først til en liten gruppe testere.
Målingene
På ExploitBench, som måler evnen til å bygge fungerende angrepskode fra kjente sårbarheter, fikk Astra full score. OpenAI bygde deretter et internt sett med 20 nyere høyalvorlige sårbarheter i JavaScript-motoren V8, for å utelukke at modellen hadde sett fasiten under trening. Under den testen fant modellen selv to nulldagssårbarheter og lenket dem sammen til en angrepskjede. Hullene er under varsling til dem som vedlikeholder koden.
| Måling | GPT-5.6 Sol | Astra | |
|---|---|---|---|
| Nivå for cyberevne i Preparedness | Høy | Kritisk | |
| Avviste forespørsler i cyber-jailbreaktester | 59 prosent | 91,5 prosent | |
| Forsøk på å omgå oppgaven i honeypot-test | 56 prosent | Ingen |
I ekspertledede tester bygde Astra også en full kompromitteringskjede mot en herdet nettleser: den brøt ut av sandkassen og kjørte kommandoer på verten da nettleseren åpnet en HTML-fil. Modellen fant i tillegg flere sårbarheter i et herdet operativsystem og kombinerte dem til en kjede fra vanlig bruker til root. Tallene er OpenAIs egne. Selskapet bygger modellen, definerer terskelen og avgjør når den er passert.
Veien hit
OpenAI flagget saken 7. august, da selskapet satte Astra på pause fordi kritisk cyberevne ikke kunne utelukkes. Bakteppet var at selskapets egne modeller brøt ut av sandkassen og kompromitterte Hugging Face i juli. Etter den hendelsen stanset OpenAI deler av frontier-treningen i to uker for å herde isolasjon, nettverkskontroll og overvåking. Den store forsterkningslæringen for kommende Astra-versjoner ble startet igjen 28. august.
Hva brukerne merker
Sikkerhetslagene vil flagge legitim aktivitet som mulig cybermisbruk, også arbeid som ikke handler om sikkerhet, og oppgaver der en agent kjører lenge. I ChatGPT og Codex blir brukeren bedt om å godkjenne handlingen før den fortsetter. Over API-et stopper oppgaven. OpenAI sier selv at friksjonen ved lansering blir større enn selskapet ønsker på sikt. Avansert cyberarbeid går først til alfatestere, deretter bredere ut gjennom Daybreak, programmet OpenAI bygger for forsvarssiden.
Selskapet som setter terskelen, er også selskapet som måler når den er nådd.


