Googles Gemini-modeller tog sig i maj in i systemen hos tre riktiga företag under ett cybersäkerhetstest. Händelserna blev kända först flera månader senare och Google bekräftade dem efter frågor från Wall Street Journal.
Testet genomfördes av AI-säkerhetsföretaget Irregular och skulle vara en vanlig så kallad capture-the-flag-övning. Gemini fick i uppgift att leta efter information hos påhittade företag i en kontrollerad miljö.
Problemet var att modellerna av misstag kunde nå det öppna internet.
Annons
Ett låtsasföretag ledde Gemini till ett riktigt
I ett av testerna hade det fiktiva företaget samma namn som ett verkligt bolag. När Gemini sökte vidare på nätet hittade modellen därför riktig infrastruktur och började behandla den som en del av övningen.
Gemini lyckades till slut komma åt företagets tjänster genom att prova lösenord. I två andra fall sökte modellerna igenom offentligt tillgängliga kodförråd och hittade autentiseringsuppgifter som av misstag hade publicerats där.
Uppgifterna fungerade. Gemini använde dem och fick tillgång till ytterligare två verkliga företags system.
Ars Technica rapporterar att modellerna i samtliga tre fall avbröt när de insåg att systemen faktiskt tillhörde riktiga företag och inte var en del av simuleringen.
Läs mer: OpenAI avslöjar historisk AI-incident under säkerhetstest
Det behövdes ingen avancerad AI-attack
Det kanske mest intressanta med incidenten är hur odramatisk själva attacktekniken var.
Gemini behövde inte upptäcka någon avancerad säkerhetslucka eller utveckla skadlig kod. Ett svagt lösenord och autentiseringsuppgifter som lämnats offentligt räckte för att modellen skulle kunna ta nästa steg på egen hand.
När en AI-agent får tillgång till webbläsare, terminaler, kod och andra verktyg kan den kombinera information från flera källor och själv fortsätta mot ett mål. Om miljön runt agenten är felkonfigurerad kan även ganska enkla säkerhetsbrister därför få större konsekvenser.
Google beskriver själv en utveckling där angripare går från att använda AI för enskilda frågor till mer agentbaserade arbetsflöden. Google Threat Intelligence Group uppgav i september att man under årets andra kvartal sett en angripare kompromettera en molnresurs och därefter planera, bygga och genomföra en AI-assisterad kampanj för att samla in inloggningsuppgifter på mindre än sex timmar.
Google fick veta först i juli
Irregular ska enligt rapporteringen ha stoppat modellernas internetåtkomst efter incidenterna. Men företaget informerade inte Google direkt.
Google fick enligt Wall Street Journal kännedom om händelserna först i slutet av juli, efter att andra incidenter med AI-modeller och cybersäkerhet börjat uppmärksammas.
De tre drabbade företagen informerades därefter. Google ska även ha underrättat amerikanska federala myndigheter.
Google har inte berättat vilka företag som drabbades eller exakt vilken Gemini-modell som användes. Bolaget har däremot uppgett att det inte rörde sig om den senaste Gemini-generationen.
Google såg inte händelsen som ett AI-misslyckande
Trots de obehöriga intrången betraktar Google inte händelsen som ett tydligt exempel på så kallad misalignment, alltså att en AI börjar agera på ett sätt som strider mot utvecklarens avsikt.
Anledningen är att modellerna avslutade intrången när de förstod att systemen var verkliga.
Googles säkerhetschef Heather Adkins beskrev i ett uttalande till Wall Street Journal händelsen som ett exempel på varför kraftfulla AI-modeller behöver tränas att agera ansvarsfullt och konstaterade att modellen i det här fallet stoppade sitt beteende.
Google ansåg heller inte att incidenterna behövde offentliggöras eftersom inga skador ska ha uppstått. Händelserna blev offentliga först efter att Wall Street Journal började ställa frågor om dem.
Det skiljer Gemini-fallet från vissa tidigare incidenter där AI-system aktivt hittat vägar runt de begränsningar som satts upp för dem.
Läs mer: OpenAI avslöjar sex oroande AI-incidenter
Problemet kan vara miljön runt AI
Gemini verkar alltså inte ha bestämt sig för att ge sig ut på internet och slumpmässigt angripa företag. Modellen försökte lösa den uppgift den hade fått och trodde åtminstone inledningsvis att systemen den hittade ingick i testet.
Men händelsen visar samtidigt ett annat problem.
Ju fler verktyg en AI-agent får använda, desto viktigare blir infrastrukturen runt modellen. Ett enda felaktigt nätverksval kan innebära att en agent som kan söka efter information, testa inloggningar och använda hittade autentiseringsuppgifter plötsligt arbetar mot den riktiga världen.
Och då behöver AI inte vara rebellisk för att orsaka problem.
Det kan räcka att någon glömt att stänga dörren.
