AINyhet

Forskare använde Claude för att hacka OpenAI

Publicerad
Hand som håller mobil med Claudes logga och höger sida hand som håller mobil med OpenAI logga.
Foto: DepositPhoto

Tre säkerhetsforskare hittade en väg från ett vanligt diskussionsforum till OpenAI interna system. Det mest uppseendeväckande var verktyget som hjälpte dem att lyckas.

Säkerhetsföretaget Hacktron AI använde Anthropics AI-modell Claude för att ta sig in på OpenAI communityforum och därefter kapa flera anställdas ChatGPT- och Codex-konton.

Ett av kontona var anslutet till OpenAI organisation på GitHub. Forskarna kunde därför nå ett internt kodarkiv och be Codex att skapa ett ändringsförslag i företagets kod.

Hela arbetet, från den första upptäckten till åtkomsten till kodarkivet, tog mindre än 72 timmar.

Annons

Ingen kriminell cyberattack

Det handlade inte om en attack utförd för att stjäla information eller skada OpenAI.

Forskarna Harsh Jaiswal, Mohan Pedhapati och Rahul Maini arbetade med säkerhetstester och rapporterade sårbarheterna genom OpenAI program för buggrapportering. Efter att de bevisat vilken åtkomst som var möjlig avbröt de testet.

För att undvika att läsa känslig kod lät forskarna det kapade Codex-kontot skapa ett ofarligt ändringsförslag i OpenAI interna kodarkiv. Det fungerade som bevis på att de faktiskt hade kommit in.

OpenAI betalade därefter forskarna 6 500 dollar i belöning.

Läs mer: Hackare kapar Claude-konton – använder andras AI-kvot

Började med en uppladdad bild

Vägen in började på community.openai.com, OpenAI offentliga diskussionsforum som använder plattformen Discourse.

Forskarna hittade en sårbarhet i ett programbibliotek som används för att behandla bilder i formaten HEIC och HEIF. En manipulerad bildfil kunde få servern att köra kod som forskarna kontrollerade.

Sårbarheten hade tidigare rättats i bibliotekets ursprungliga kod, men ändringen hade inte markerats som en säkerhetsuppdatering och saknade ett officiellt CVE-nummer. Därför hade rättningen inte nått alla system som använde biblioteket.

Att komma in på forumets server var däremot bara det första steget. Forskarna kombinerade bildproblemet med en separat brist i OpenAI system för gemensam inloggning.

Kombinationen gjorde det möjligt att gå från det komprometterade forumet till aktiva användares ChatGPT- och Codex-konton utan att användarna behövde klicka på något.

Den äldre Claude-modellen misslyckades

Forskarna använde först Claude Opus 4.8 för att försöka skapa en fungerande attack. Modellen hittade sårbarheten och kunde få delar av metoden att fungera, men misslyckades med att göra attacken tillräckligt tillförlitlig mot forumets riktiga konfiguration.

När Anthropic lanserade Claude Opus 5 förändrades resultatet. Den nya modellen lyckades på några timmar skapa en fungerande version för den miljö som Discourse använde.

Forskarna lät därefter Claude arbeta mer självständigt mot deras egen testinstallation. AI-modellen lyckades anpassa metoden och få fjärråtkomst till systemet.

Forskarna betonar att attacken inte var helt autonom. Claude behövde fortfarande vägledning från människor med avancerad säkerhetskompetens. Modellen gjorde det däremot möjligt för en grupp på bara tre personer att genomföra arbetet betydligt snabbare.

Läs mer: OpenAI avslöjar historisk AI-incident under säkerhetstest

OpenAI täppte till hålet på 14 timmar

Forskarna rapporterade problemet till OpenAI den 25 juli. Ungefär 14 timmar senare bekräftade företaget att bristen på OpenAI sida hade åtgärdats.

Discourse informerades samma dag och hade en rättning färdig två dagar senare. Företaget införde även en isolerad miljö för bildbehandlingen som ett extra skydd.

OpenAI har förtydligat att belöningen på 6 500 dollar gällde sårbarheten i företagets eget inloggningssystem. Testerna mot det Discourse-baserade forumet ingick egentligen inte i OpenAI program.

Kunde ha nått betydligt mer

Det kapade kontot gav forskarna möjlighet att nå OpenAI interna kod genom kopplingen mellan Codex och GitHub. Den potentiella omfattningen var däremot större.

ChatGPT och Codex kan anslutas till tjänster som e-post, molnlagring, Slack och GitHub. Om ett kapat konto har sådana anslutningar kan angriparen i teorin nå betydligt mer än användarens AI-konversationer.

Forskarna säger att de inte använde åtkomsten för att läsa OpenAI interna kod eller utforska andra anslutna tjänster.

Läs mer: Så ser du om ditt ChatGPT-konto har blivit hackat

AI sänker tröskeln för avancerade attacker

Händelsen visar inte att Claude på egen hand bestämde sig för att attackera OpenAI. Modellen användes av säkerhetsforskare som hade ett tydligt mål och övervakade arbetet.

Det viktiga är i stället hur snabbt AI kan omvandla en komplicerad sårbarhet till en fungerande attack. Arbete som tidigare kunde kräva ett större team och flera månaders utveckling kan nu pressas ihop till några dagar.

Säkerhetsantagandena måste hinna ikapp angriparnas förmåga, skriver forskarna i sin rapport.

Läs mer: AI-agenter bröt sig ut och lämnade 18 000 meddelanden