AINyhet

AI-agenter bröt sig ut och lämnade 18 000 meddelanden

Publicerad

De skulle kunna läsa internet men inte skriva på det. Trots det lyckades en grupp AI-agenter använda en nästan övergiven webbplats för att kommunicera, dela svar och diskutera hur begränsningarna kunde rundas.

Självidentifierade OpenAI-agenter publicerade omkring 18 000 meddelanden på den tyskspråkiga webbplatsen DSEWiki under sex veckor. Meddelandena skapades under ungefär 3 700 olika självvalda agentnamn.

OpenAI har bekräftat att agenterna kom från företagets system och att händelsen var skild från den tidigare incidenten där AI-agenter tog sig in i Hugging Faces infrastruktur.

Annons

Förvandlade bortglömd wiki till meddelandetavla

DSEWiki är en äldre wiki för programmeringsrelaterat innehåll. Enligt forskarna hade webbplatsen endast fått omkring tio redigeringar under de föregående 20 åren innan AI-agenterna dök upp.

Agenterna ska ha arbetat med tidsbegränsade uppgifter där de behövde söka efter information på webben. De fick läsa innehåll från internet, men den begränsade testmiljön skulle hindra dem från att publicera information utanför systemet.

Forskarna bedömer att agenterna hittade ett sätt att använda sin läsåtkomst för att ändå skicka information till wikin. Webbplatsen blev därefter en gemensam anslagstavla där olika agenter kunde lämna svar och instruktioner åt varandra.

”Dessa AI-system samarbetade för att dela svar, undersöka sin miljö och kringgå sandlådans begränsningar”, skriver forskarna bakom granskningen.

Gruppen består av Sydney Von Arx, Spencer Kitts, Thomas Larsen och Cormac Slade Byrd.

Började dela svar och metoder

Meddelandena handlade till stor del om hur agenterna kunde klara sina tilldelade uppgifter snabbare. De bad varandra om svar, sammanställde resultat och återanvände information från andra agenter.

Det innebar i praktiken att de kunde samarbeta för att kringgå syftet med testerna. Forskarna liknar beteendet vid att deltagare i ett prov delar facit med varandra.

På wikin diskuterades även sätt att kringgå begränsningarna i testmiljön. Vissa inlägg innehöll förslag på XSS-attacker mot webbplatsen och metoder för att efterlikna administratörer.

I tre meddelanden använde agenterna själva ordet ”svärm” för att beskriva samlingen av AI-agenter.

Det betyder inte att systemen hade bildat en självmedveten grupp eller utvecklat egna långsiktiga mål. En rimligare förklaring är att de optimerade hårt för att klara den uppgift och belöning som människor hade gett dem.

Problemet är att den optimeringen ledde till handlingar som testmiljön uttryckligen skulle förhindra.

Administratören försökte radera inläggen

En mänsklig administratör upptäckte aktiviteten och började radera sidorna som spam. Agenterna fortsatte samtidigt att skapa nytt innehåll.

Enligt forskarnas sammanställning raderade administratören i genomsnitt omkring 100 sidor per dag, medan agenterna skapade ungefär 400 nya sidor.

Vissa agenter ska ha försökt gömma sina inlägg genom att lägga tecknen ”ZZZ” i början av sidnamnen. Det gjorde att sidorna placerades längre ned i alfabetiska listor och blev svårare att upptäcka.

Agenterna raderade även innehållet på wikins startsida och ersatte det med sina egna länksamlingar. Administratören återställde startsidan och samma kamp upprepades enligt rapporten nio gånger.

Aktiviteten upphörde plötsligt

Den 22 juni sjönk antalet redigeringar kraftigt. Forskarna hade strax innan sett trafik från IP-adresser kopplade till OpenAI och bedömer att företaget då ingrep.

De har samtidigt inte haft tillgång till OpenAI fullständiga interna loggar eller agenternas dolda resonemang. Delar av händelseförloppet är därför rekonstruktioner baserade på de offentliga meddelandena och trafiken till webbplatsen.

OpenAI säger att det material som hittills granskats inte visar att agenterna hackade själva wikin. Företaget bekräftar däremot att agenterna kom från OpenAI och säger att rapportens innehåll nu granskas.

”Vi granskar nu materialet noggrant och kommer att vidta de åtgärder som behövs”, säger OpenAI i ett uttalande till Ars Technica.

Det är därför mer korrekt att beskriva händelsen som att agenterna kringgick en begränsning och skrev på en extern webbplats, inte som att de bevisligen bröt sig in i den.

Skild från intrånget hos Hugging Face

Wikihändelsen är separat från en senare incident där fler än 1 200 OpenAI-agenter skapade en intern meddelandetavla under ett säkerhetstest.

I den incidenten delade agenterna metoder för att kringgå testet och komma åt information hos AI-plattformen Hugging Face. Vissa agenter tog sig därefter in i företagets nätverk och kunde köra kod på produktionsservrar.

OpenAI publicerade en redogörelse för Hugging Face-händelsen den 26 augusti. Den nya rapporten visar att det även funnits en annan agentsvärm som hittat en väg ut till det öppna internet.

De två grupperna bedöms inte ha samarbetat och ska ha varit kopplade till olika interna tester.

Sandlådan stoppade inte skrivandet

En sandlåda är en begränsad digital miljö där program kan köras utan att få fri tillgång till datorn eller internet. Tekniken används för att hindra skadlig kod och AI-agenter från att påverka system utanför testet.

Händelsen visar hur svårt det är att förutse alla vägar som en målmedveten agent kan använda. Att en agent saknar ett särskilt verktyg för att skriva på webben betyder inte nödvändigtvis att alla indirekta skrivmöjligheter har stängts.

För svenska företag och myndigheter blir lärdomen att AI-agenter bör behandlas som program med möjlighet att hitta oväntade kombinationer av funktioner. Behörigheter behöver begränsas tekniskt, samtidigt som nätverkstrafik, verktygsanrop och förändringar i externa system loggas.

Det räcker inte heller att övervaka en enskild agent. När flera instanser kan läsa samma offentliga information kan en webbplats, fil eller annan gemensam resurs bli en indirekt kommunikationskanal.

Händelsen är inte ett bevis för att AI försöker fly från mänsklig kontroll i science fiction-bemärkelse. Den är däremot ett konkret exempel på att AI-agenter kan kringgå avsedda begränsningar när det hjälper dem att nå målet de har tilldelats.