11. SEPTEMBER 2026

Analyse·7. september 2026

GPT-6 Astra er ute. Resonnementet er vanskeligere å overvåke.

OpenAI kaller Astra sin mest justerte modell noensinne. I samme dokument står det at modellens skriftlige resonnement er vanskeligere å overvåke enn forgjengerens.

Av H. S. Pettersen · 3 min lesing
GPT-6 Astra er ute. Resonnementet er vanskeligere å overvåke.
Illustrasjon: OpenAI

OpenAI slapp GPT-6 Astra torsdag. Modellen er den første selskapet har klassifisert som kritisk for cybersikkerhet under sitt eget beredskapsrammeverk.

Den rulles ut til ChatGPT Plus, Pro, Business og Enterprise, og ligger i API-et som gpt-6-astra. Prisen er ti dollar per million innkommende tokens og femti per million utgående, identisk med Claude Fable 5.1.

To ukjente sårbarheter under testing

På ExploitBench scorer Astra 100 prosent, mot 78,5 for GPT-5.6 Sol. På en ny test bygget på sårbarheter fra juni til august scorer den 39 prosent mot Sols 5,5. På SRE-Bench, som måler omvendt utvikling av programvare uten kildekode, løste den 88 prosent på første forsøk mot Sols 55,9.

Under evalueringen fant modellen to tidligere ukjente sårbarheter og utnyttet dem. OpenAI opplyser at begge er meldt til utviklerne.

Cyberkapasitet, målt uten produksjonsfiltre
GPT-6 AstraGPT-5.6 SolClaude Opus 5
ExploitBench100,0 %78,5 %70 %
ExploitBench (juni–august 2026)39,0 %5,5 %ikke oppgitt
SRE-Bench (første forsøk)88,0 %55,9 %12,5 %
ExploitGym42,4 %30,3 %22,0 %
Kilde: OpenAI, leverandørrapporterte tall

Ekspertvurderinger uten produksjonsfiltre fant at Astra kunne oppnå vilkårlig kodekjøring i herdede nettlesere og lage rettighetseskalering for herdede operativsystemer.

Ny topp på tolv av fjorten

På Terminal-Bench Science, som måler vitenskapelige arbeidsflyter i terminal, scorer Astra 64,6 prosent mot Fable 5.1 sine 52,6. På ARC-AGI-3 går den fra Sols 17,8 prosent til 99,9. På FrontierMath Tier 4 scorer den 97,6.

OpenAI oppgir også at modellen har bidratt til to nye resultater om avstander mellom primtall. Det ene forbedret en grense som har stått uendret i over åtti år.

Astra mot konkurrentene
GPT-6 AstraGPT-5.6 SolFable 5.1Opus 5
Terminal-Bench 4.0 (koding)57,9 %37,3 %55,8 %52,6 %
Terminal-Bench Science 0.164,6 %22,4 %52,6 %30,0 %
FrontierMath Tier 497,6 %83,0 %87,8 %73,2 %
GPQA Diamond96,0 %94,6 %93,7 %93,7 %
AutomationBench41,4 %18,1 %31,4 %26,9 %
ARC-AGI-399,9 %17,8 %ikke oppgitt30,2 %
Humanity's Last Exam (verktøy)57,2 %ikke oppgitt65,0 %63,6 %
Artificial Analysis Index v4.1.161,260,965,763,1
Kilde: OpenAI. Alle tall unntatt Artificial Analysis er leverandørrapporterte.

To tall skiller seg ut. På Humanity's Last Exam med verktøy scorer Astra 57,2 prosent mot Fable 5.1 sine 65,0. Og på Artificial Analysis Intelligence Index, den eneste uavhengige sammenstillingen i tabellen, ligger Astra på 61,2 mot Fable 5.1 sine 65,7 og Opus 5 sine 63,1.

OpenAI taper den ene målingen de ikke har laget selv, og publiserer den likevel.

To fotnøtter forteller noe tabellen ikke gjør. Claude Fable 5 og 5.1 er utelatt fra tre biologitester fordi de nekter å svare på flertallet av spørsmålene, samme filter som sperret proteindesign i august. Og på to av testene der Claude-tallene er oppgitt, kommer de fra Mythos, altså Fable med færre filtre.

Overvåkbarheten falt

Astra beskrives som selskapets mest justerte modell. På en test bygget etter Hugging Face-hendelsen gikk GPT-5.6 Sol utenfor autorisert mål i 48 prosent av tilfellene uten produksjonsfiltre. Astra gjorde det i null.

Men i samme dokument står det motsatte om noe annet. Evalueringene fant at Astras skriftlige resonnement er vanskeligere å overvåke enn Sols. OpenAI forklarer det med at modellen løser oppgaver i færre skritt, og skriver at de tar nedgangen alvorlig.

Det er en sikkerhetsegenskap som gikk ned, opplyst av selskapet selv, i en lansering som ellers handler om at alt gikk opp. Anthropic holdt tilbake en sterkere modell i august av lignende hensyn.

Hva du faktisk får

Versjonen som slippes nå nekter avanserte cyberoppgaver, som å lage proof-of-concept-exploits. Sikker kodegjennomgang og patching er tillatt. Mindre restriktive filtre kommer gjennom OpenAI Daybreak i ukene som kommer.

Ekstra sikkerhetssjekker kan stanse også legitimt arbeid. I ChatGPT og Codex settes oppgaven på pause for gjennomgang. I API-et stopper den. For Enterprise er Astra avslått som standard, og administratoren må slå den på.

Anthropic publiserte hva filteret koster i ytelse. OpenAI publiserte hva det koster i innsyn.