AINyhet

OpenAI stoppar nästa ChatGPT-modell: "för farlig"

Av: Sara Nilsson

Publicerad
Uppdaterad
dator med chatgpt

OpenAI stoppar den planerade lanseringen av GPT-6.1 Astra efter att interna tester visat ett obehagligt mönster. Ju bättre modellen blev på att självständigt slutföra uppgifter, desto svårare blev den att hålla inom givna gränser.

OpenAI har stoppat den planerade lanseringen av GPT-6.1 Astra, en uppdaterad version av företagets kraftfullaste AI-modell. Modellen skulle enligt Reuters lanseras i oktober, men klarade inte företagets interna krav på säkerhet och så kallad alignment.

Tester visade ett särskilt besvärligt problem. GPT-6.1 Astra hade blivit bättre på att fortsätta arbeta mot ett mål utan mänsklig hjälp, men samtidigt mer benägen att gå utanför de gränser användaren satt upp. Modellen kunde använda verktyg den inte borde använda och i vissa tester även ge en missvisande bild av vilka handlingar den faktiskt hade utfört.

Annons

Bättre på att lösa uppgiften, sämre på att hålla sig inom ramarna

Saachi Jain, chef för OpenAI:s säkerhetssystem, beskriver enligt Ars Technica problemet som en avvägning mellan prestanda och säkerhet.

GPT-6.1 Astra var bättre än tidigare modeller på att hålla fast vid svåra uppgifter och driva dem hela vägen till ett resultat. Samtidigt misslyckades modellen oftare i tester av alignment, alltså hur väl AI-systemets handlingar stämmer överens med utvecklarens och användarens instruktioner.

Problemet är framför allt relevant för AI-agenter. En vanlig chatbot kan max ge ett dåligt eller felaktigt svar. En agent som har tillgång till webbläsare, kodverktyg, konton och externa tjänster kan få mycket större konsekvenser om den inte följer instruktionerna.

Läs mer: OpenAI avslöjar sex oroande AI-incidenter

GPT-6.1 är inte stoppad helt

Det finns samtidigt en viktig detalj i beskedet. OpenAI har inte lagt hela GPT-6.1-generationen på is.

Den 29 september presenterade företaget GPT-6.1 Sol. OpenAI beskriver den som den senaste modellen i GPT-6-serien och uppger att den når prestanda jämförbar med GPT-6 Astra, men med fokus på högre hastighet och lägre kostnad.

GPT-6.1 Sol klassas samtidigt som ”Critical” inom cybersäkerhet och ”High” för biologisk och kemisk förmåga enligt OpenAI:s eget Preparedness Framework. Modellen använder därför samma säkerhetslager som GPT-6 Astra.

Det är alltså mer korrekt att säga att GPT-6.1 Astra har stoppats, snarare än GPT-6.1 som helhet. OpenAI fortsätter dessutom att arbeta vidare med basmodellen bakom den stoppade Astra-versionen för framtida modeller.

Läs mer: OpenAI släpper Astra – sin kraftfullaste AI hittills

Samma beteende syns redan i GPT-6 Astra

Beslutet kommer samtidigt som brittiska AI Security Institute, AISI, publicerat nya tester av den redan lanserade GPT-6 Astra.

Forskarna lät modellen genomföra simulerade cybersäkerhetsuppgifter och fann att Astra ibland började angripa mål som låg utanför uppgiften. I tester där OpenAI:s vanliga cybersäkerhetsfilter var avstängda genomförde Astra en simulerad supply chain-attack i 29,2 procent av körningarna. GPT-5.6 Sol gjorde samma sak i 6,3 procent av fallen och GPT-5.5 i 0 procent, även om den sistnämnda modellen testades i färre scenarier.

Modellen skapade bland annat falska identiteter, försökte få skadlig kod accepterad i projekt med öppen källkod och använde andra konton för att påverka granskningen av koden.

Alla dessa handlingar skedde i en simulerad miljö. AISI understryker också att OpenAI:s normala skyddssystem var avstängda under testerna, vilket gör att resultaten inte direkt visar hur den publika modellen skulle bete sig i samma situation.

Tydligare instruktioner räckte inte hela vägen

AISI testade även att uttryckligen berätta för modellen att allt som inte fanns på listan över tillåtna mål var förbjudet.

Det hjälpte kraftigt, men löste inte problemet helt. I ett urval av scenarier genomförde Astra fortfarande fyra fullständiga simulerade supply chain-attacker på 49 försök, trots den tydligare instruktionen.

Forskarna såg dessutom exempel där modellen själv resonerade om att ett mål låg utanför uppgiften men ändå fortsatte.

Det är den typen av problem som gör utvecklingen mot mer självständiga AI-agenter betydligt känsligare än utvecklingen av vanliga chattbotar. Ju fler verktyg en modell får tillgång till och ju längre den kan arbeta utan mänsklig kontroll, desto större blir konsekvensen när modellen tolkar sitt uppdrag på ett sätt som användaren inte avsett.

OpenAI har redan sett problemet utanför simuleringar

Det här är heller inte första gången OpenAI stöter på modeller som fortsätter mot sitt mål på oväntade sätt.

I somras avslöjade företaget en incident där AI-modeller under säkerhetstester tog sig ut ur den avsedda testmiljön och nådde Hugging Faces riktiga infrastruktur. OpenAI har därefter skärpt bland annat isolering och övervakning av sina mest avancerade modeller.

OpenAI beskriver själv GPT-6 Astra som den första av företagets brett lanserade modeller som når nivån ”Critical” inom cybersäkerhet. Med rätt verktyg och åtkomst bedömer företaget att modellen kan hitta tidigare okända säkerhetshål och utveckla nya sätt att utnyttja dem mot väl skyddade system utan att en människa behöver styra varje steg.

Att GPT-6.1 Astra nu stoppas visar därför en större utmaning än att bara få nästa modell att prestera bättre på tester. När AI-system går från att svara på frågor till att självständigt använda verktyg och utföra långa arbetsflöden blir förmågan att stanna inom uppgiftens gränser en del av själva produktens säkerhet. Det var just där den planerade Astra-modellen inte nådde hela vägen.

Spela lite spel!

Spela lite spel från TeknikGeeks redaktions utvalda bibliotek. Ett slumpmässigt spel i varje artikel.