GPT-6 Astra er ute. Resonnementet er vanskeligere å overvåke.
OpenAI kaller Astra sin mest justerte modell noensinne. I samme dokument står det at modellens skriftlige resonnement er vanskeligere å overvåke enn forgjengerens.
Av H. S. Pettersen · 3 min lesing
OpenAI slapp GPT-6 Astra torsdag. Modellen er den første selskapet har klassifisert som kritisk for cybersikkerhet under sitt eget beredskapsrammeverk.
Den rulles ut til ChatGPT Plus, Pro, Business og Enterprise, og ligger i API-et som gpt-6-astra. Prisen er ti dollar per million innkommende tokens og femti per million utgående, identisk med Claude Fable 5.1.
To ukjente sårbarheter under testing
På ExploitBench scorer Astra 100 prosent, mot 78,5 for GPT-5.6 Sol. På en ny test bygget på sårbarheter fra juni til august scorer den 39 prosent mot Sols 5,5. På SRE-Bench, som måler omvendt utvikling av programvare uten kildekode, løste den 88 prosent på første forsøk mot Sols 55,9.
Under evalueringen fant modellen to tidligere ukjente sårbarheter og utnyttet dem. OpenAI opplyser at begge er meldt til utviklerne.
| GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | |
|---|---|---|---|
| ExploitBench | 100,0 % | 78,5 % | 70 % |
| ExploitBench (juni–august 2026) | 39,0 % | 5,5 % | ikke oppgitt |
| SRE-Bench (første forsøk) | 88,0 % | 55,9 % | 12,5 % |
| ExploitGym | 42,4 % | 30,3 % | 22,0 % |
Ekspertvurderinger uten produksjonsfiltre fant at Astra kunne oppnå vilkårlig kodekjøring i herdede nettlesere og lage rettighetseskalering for herdede operativsystemer.
Ny topp på tolv av fjorten
På Terminal-Bench Science, som måler vitenskapelige arbeidsflyter i terminal, scorer Astra 64,6 prosent mot Fable 5.1 sine 52,6. På ARC-AGI-3 går den fra Sols 17,8 prosent til 99,9. På FrontierMath Tier 4 scorer den 97,6.
OpenAI oppgir også at modellen har bidratt til to nye resultater om avstander mellom primtall. Det ene forbedret en grense som har stått uendret i over åtti år.
| GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Opus 5 | |
|---|---|---|---|---|
| Terminal-Bench 4.0 (koding) | 57,9 % | 37,3 % | 55,8 % | 52,6 % |
| Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 30,0 % |
| FrontierMath Tier 4 | 97,6 % | 83,0 % | 87,8 % | 73,2 % |
| GPQA Diamond | 96,0 % | 94,6 % | 93,7 % | 93,7 % |
| AutomationBench | 41,4 % | 18,1 % | 31,4 % | 26,9 % |
| ARC-AGI-3 | 99,9 % | 17,8 % | ikke oppgitt | 30,2 % |
| Humanity's Last Exam (verktøy) | 57,2 % | ikke oppgitt | 65,0 % | 63,6 % |
| Artificial Analysis Index v4.1.1 | 61,2 | 60,9 | 65,7 | 63,1 |
To tall skiller seg ut. På Humanity's Last Exam med verktøy scorer Astra 57,2 prosent mot Fable 5.1 sine 65,0. Og på Artificial Analysis Intelligence Index, den eneste uavhengige sammenstillingen i tabellen, ligger Astra på 61,2 mot Fable 5.1 sine 65,7 og Opus 5 sine 63,1.
OpenAI taper den ene målingen de ikke har laget selv, og publiserer den likevel.
To fotnøtter forteller noe tabellen ikke gjør. Claude Fable 5 og 5.1 er utelatt fra tre biologitester fordi de nekter å svare på flertallet av spørsmålene, samme filter som sperret proteindesign i august. Og på to av testene der Claude-tallene er oppgitt, kommer de fra Mythos, altså Fable med færre filtre.
Overvåkbarheten falt
Astra beskrives som selskapets mest justerte modell. På en test bygget etter Hugging Face-hendelsen gikk GPT-5.6 Sol utenfor autorisert mål i 48 prosent av tilfellene uten produksjonsfiltre. Astra gjorde det i null.
Men i samme dokument står det motsatte om noe annet. Evalueringene fant at Astras skriftlige resonnement er vanskeligere å overvåke enn Sols. OpenAI forklarer det med at modellen løser oppgaver i færre skritt, og skriver at de tar nedgangen alvorlig.
Det er en sikkerhetsegenskap som gikk ned, opplyst av selskapet selv, i en lansering som ellers handler om at alt gikk opp. Anthropic holdt tilbake en sterkere modell i august av lignende hensyn.
Hva du faktisk får
Versjonen som slippes nå nekter avanserte cyberoppgaver, som å lage proof-of-concept-exploits. Sikker kodegjennomgang og patching er tillatt. Mindre restriktive filtre kommer gjennom OpenAI Daybreak i ukene som kommer.
Ekstra sikkerhetssjekker kan stanse også legitimt arbeid. I ChatGPT og Codex settes oppgaven på pause for gjennomgang. I API-et stopper den. For Enterprise er Astra avslått som standard, og administratoren må slå den på.
Anthropic publiserte hva filteret koster i ytelse. OpenAI publiserte hva det koster i innsyn.


