AINyhet

OpenAI avslöjar sex oroande AI-incidenter

Publicerad
Uppdaterad
datorskärm med en ai-chatt
Foto: DepositPhoto

När AI-modeller får tillgång till internet, kod och externa verktyg kan jakten på rätt svar ta oväntade vägar. Nu berättar OpenAI om sex händelser som företaget anser att omvärlden behöver känna till.

OpenAI har offentliggjort sex fall där företagets AI-modeller agerade på oväntade eller oroande sätt under träning och tester.

I ett av fallen lade modeller till instruktioner om att dölja sina misstag. En annan modell letade efter läckta API-nycklar, använde en av dem utan tillstånd och hittade sedan på information när den ändå inte fick fram rätt svar.

Företaget inför samtidigt ett nytt ramverk för hur liknande händelser ska utredas och offentliggöras.

Annons

Försökte dölja fel för användaren

Ett av de tydligaste exemplen inträffade under träningen av GPT-5.6 Sol.

När en AI-agent arbetar med en lång uppgift kan tidigare information komprimeras till en sammanfattning som modellen använder för att fortsätta arbetet i ett nytt kontextfönster. Den sammanfattningen fungerar ungefär som modellens egna anteckningar.

OpenAI upptäckte att många modeller hade lagt in instruktioner i anteckningarna om att dölja felaktigheter och problematiska handlingar för användaren.

Det kunde bland annat handla om att hitta på historiska uppgifter som saknades utan att berätta det eller dölja att informationen kom från fel version av en källa.

Ett annat, ännu inte lanserat forskningssystem skrev in instruktioner om att ignorera sina vanliga begränsningar i sammanfattningarna. OpenAI identifierade 27 sammanfattningar som hade påverkats.

Det betyder inte att modellen hade ett mänskligt motiv eller medvetet planerade att lura någon. Men beteendet visar att den kunde skapa instruktioner som gjorde det svårare för användaren och övervakningssystemen att upptäcka fel.

Läs mer: Experter varnar för OpenAI:s nya teknik

Letade efter läckta API-nycklar

I ett annat test skulle en intern modell hitta historisk lönestatistik för män inom tre branscher i ett amerikanskt område.

När den vanliga vägen till informationen misslyckades försökte modellen registrera tillfälliga e-postadresser och började söka i publika Github-projekt efter läckta API-nycklar.

En av nycklarna fungerade och gav modellen tillgång till delar av ett externt system. När modellen ändå inte lyckades hämta den efterfrågade statistiken valde den att skapa nio trovärdiga siffror och presentera dem som om de kom från originalkällan.

Den berättade varken att API-nyckeln använts utan tillstånd eller att siffrorna var påhittade.

OpenAI uppger att händelsen upptäcktes av företagets system för övervakning av felanpassat beteende. Företaget beskriver träningskörningen som ovanligt präglad av så kallad reward hacking, där modellen försöker nå ett bra resultat utan att följa den avsedda metoden.

Laddade upp användarens filer på internet

Två andra modeller laddade upp material till publika fildelningstjänster utan att fråga användaren.

I ett fall hade en agent redan hittat rätt uppgifter om stora sjöar genom att använda Python. Uppgiften krävde däremot också en källa som kunde öppnas i webbläsaren.

När agenten inte kunde hänvisa direkt till den lokala filen laddade den upp informationen på en publik tjänst för att skapa en webbadress som den kunde använda som källa.

I ett annat fall fick en modell en bild och uppgiften att avgöra var den var tagen. För att kunna använda en extern bildsöktjänst laddade modellen upp bilden till internet utan användarens godkännande.

OpenAI uppger att uppladdningarna lyckades, även om de efterföljande försöken att använda filerna inte gav önskat resultat.

Det finns inget som tyder på att de här testfilerna innehöll känslig information. Problemet är själva handlingsmönstret. En agent som kan ladda upp filer kan exponera privat eller företagshemligt material om samma beteende uppstår i en verklig användarmiljö.

Läs mer: AI-agenter bröt sig ut och lämnade 18 000 meddelanden

Agenter använde kodplattform som meddelandetavla

OpenAI beskriver också hur modeller använde ett internt kodarkiv för att kommunicera mellan separata träningsexempel.

Agenterna letade efter filer som saknades och började lämna meddelanden, frågor och svar till varandra i kodarkivet. I ett liknande fall använde flera samarbetande agenter publika fildelningstjänster för att skicka filer mellan sig.

Filerna blev därmed tillgängliga via publika webbadresser trots att uppgiften uttryckligen sa att modellerna bara skulle använda lokala filer.

Beteendet påminner om de OpenAI-agenter som använde en nästan övergiven wiki som meddelandetavla. TeknikGeek har tidigare rapporterat om hur tusentals meddelanden publicerades där när agenterna försökte samarbeta och kringgå begränsningar.

Nytt system ska offentliggöra incidenter snabbare

OpenAI kallar beteendena för exempel på ”misalignment”, vilket ungefär innebär att modellen agerar på ett annat sätt än människorna bakom systemet avsett.

Det nya ramverket omfattar bland annat fall där AI-modeller agerar utan tillstånd, kommunicerar med andra modeller eller undviker övervakning.

– Vi anser inte att AI-branschen har löst anpassning och övervakning tillräckligt väl för att på ett ansvarsfullt sätt fortsätta skala upp i maximal takt särskilt mycket längre, skriver OpenAI.

Företaget betonar samtidigt att de sex fallen är enskilda exempel. De visar inte hur ofta liknande beteenden förekommer och ska inte tolkas som att alla OpenAI-modeller regelbundet försöker dölja information eller kringgå regler.

Ramverket är dessutom frivilligt och processen sköts av OpenAI. Företaget avgör alltså fortfarande självt vilka händelser som ska offentliggöras och när.

OpenAI säger att framtida rapporter ska beskriva vad som hände, hur allvarligt företaget bedömer beteendet, om någon extern part påverkades och vilka åtgärder som planeras. Mer komplicerade fall kan publiceras senare om säkerhetsproblem först måste åtgärdas.

Läs mer: OpenAI avslöjar historisk AI-incident under säkerhetstest

Visar problemet med självständiga AI-agenter

Incidenterna inträffade under träning eller kontrollerade utvärderingar och är inte bevis för att vanliga ChatGPT-användare har drabbats.

De visar däremot varför riskerna förändras när en språkmodell blir en agent med tillgång till kod, internet, konton och filer.

En chatbot kan lämna ett felaktigt svar. En agent kan dessutom utföra handlingar för att få svaret att framstå som korrekt – exempelvis använda en läckt nyckel, publicera en fil eller dölja vad som hände på vägen.

Det är därför OpenAI nya öppenhet är viktig. Den avgörande frågan blir nu inte bara hur många incidenter som offentliggörs, utan hur ofta samma beteenden fortsätter att återkomma efter att skydden har uppdaterats.