14. SEPTEMBER 2026

AI-nyheter·9. september 2026

Forskeren sluttet i Anthropic. Kollegaen tallfestet risikoen.

Jacob Coxon sier laboratoriene gambler med livene våre. Anthropics egen justeringsleder svarte med et tall: over ti prosent innen tiåret.

Av H. S. Pettersen · 2 min lesing
Forskeren sluttet i Anthropic. Kollegaen tallfestet risikoen.
Foto: Skjermbilde fra X

Begreper i denne artikkelen

AlignmentArbeidet med å få en modell til å følge menneskelige mål og verdier. Feiljustering er når modellen forfølger noe annet enn det den ble bedt om.
AGIArtificial General Intelligence — hypotetisk AI som kan utføre enhver intellektuell oppgave like godt som et menneske.
Frontier-modellDe mest kapable modellene på markedet til enhver tid. Begrepet brukes i regulering for å skille dem som krever ekstra tilsyn fra resten.

Jacob Coxon har sagt opp i Anthropic. I en tråd på X tirsdag kveld skrev forskeren, som har brukt tre år på pretrening hos først OpenAI og så Anthropic, at begge selskapene «kjører rett mot selvforbedrende superintelligens og gambler med livene våre».

Hva han skrev

Coxon hevder at de som bygger teknologien selv tror den kan drepe alle før tiåret er omme, og at han hører den frykten uttrykt privat av folk som formulerer seg forsiktigere i pressen. Hos OpenAI har mange ikke tatt konsekvensene inn over seg, mener han, mens Anthropic forstår risikoen godt, men er låst i et kappløp om å komme først. «Å akseptere dette kappløpet og gå inn i sluttspillet er et hovmodig veddemål som ikke bør startes fra en privat bedrifts Slack», skrev han. Til Wall Street Journal sa han at ting kan være ute av kontroll allerede ved utgangen av neste år.

Kollegaen gikk lenger

>10%
Sannsynlighet for at KI utsletter menneskeheten
Anslaget kommer fra Evan Hubinger, som leder justeringsforskningen i Anthropic, og gjelder det neste tiåret. Han understreker at risikoen fra dagens modeller er lav, og at frykten gjelder superintelligens som oppstår gjennom rekursiv selvforbedring.
Kilde: Evan Hubinger på X, 9. september 2026.

Evan Hubinger svarte offentlig at teamet «oppriktig tror KI kan drepe alle mennesker», og la til at Anthropic ikke har noen plan for å løse justering av superintelligens. Anslaget står også i selskapets egen risikorapport, samme sjanger som avdekket at bioklassifikatorene sto av i elleve måneder. Anthropic svarte ikke på TechCrunchs henvendelse om oppsigelsen.

Lovforslagene ligger allerede

Connor Leahy, amerikansk direktør i KI-sikkerhetsorganisasjonen ControlAI, kaller rekursiv selvforbedring den mest sannsynlige kandidaten til punktet der kontrollen ryker. Han har rådgitt to lovforslag som nå ligger til behandling: Bernie Sanders og Greg Casar la frem Ban Artificial Superintelligence Act i Kongressen forrige uke, og Labour-representanten Alex Sobel la frem Artificial Superintelligence Security Bill i Parlamentet tirsdag. Kravet om lavere tempo er ikke nytt: OpenAIs sjefforsker ba om det samme søndag.

Coxon er ute av bransjen. Anslaget han sluttet over står fortsatt i arbeidsgiverens egen rapport.