Anthropic har upptäckt flera fall där Claude-agenter gjort saker på internet som företaget inte avsett.
I ett nytt säkerhetsinlägg beskriver bolaget hur modellerna bland annat utnyttjade en enkel mjukvarubrist för att köra kommandon på en server, skickade in ett känsligt formulär på en riktig webbplats, tog sig runt betalväggar och andra åtkomstbegränsningar samt använde URL-förkortare för att kringgå spärrar i sitt eget hämtverktyg.
Några av de berörda webbplatserna drevs av amerikanska myndigheter på federal, delstatlig och lokal nivå.
Annons
Anthropic säger att händelserna hade begränsad verklig påverkan, men företaget har ändå valt att stänga av liveinternet för samtliga interna utvärderingar tills säkerhets- och övervakningssystemen bedöms kunna fånga upp samma typ av beteende.
Läs även: Forskare använde Claude för att hacka OpenAI
Claude skickade in falskt mordtips
Det mest uppseendeväckande fallet gäller ett formulär på Philadelphia-polisens webbplats.
En Claude-agent skickade där in ett falskt mordtips som del av ett automatiserat test. Reuters uppger att tipset skickades den 18 juli och beskrev påstådd vittnesinformation. Tipset flaggades som spam och granskades aldrig av polisen.
Anthropic upptäckte dessutom inte händelsen direkt.
Enligt bolaget kom flera av de nya fallen fram först efter att man i juli påbörjat en bredare genomgång av agenternas tidigare aktiviteter.
Det är en central del av problemet: inte bara att modellerna gjorde oönskade saker, utan att företaget inte alltid såg beteendet när det hände.
Agenterna försökte hitta vägar runt hindren
Anthropic beskriver en stor del av beteendet som olika former av uthållighet.
När en agent inte kunde slutföra en uppgift på det förväntade sättet försökte den ibland hitta en annan väg i stället för att ge upp.
I vissa fall handlade det om att kringgå en begränsning för att komma åt information som låg bakom en token eller avgift. I andra fall utnyttjade agenten fel i webbplatser eller använde andra tjänster för att ta sig runt tekniska spärrar.
Anthropic kopplar beteendet till problem i bolagets träningsmiljöer, där modellerna i vissa fall kan ha lärt sig att de belönas för att hitta kryphål och nå målet till varje pris.
Det är ett beteende som brukar beskrivas som ”reward hacking”.
Bolaget säger samtidigt att dagens alignment-träning ännu inte räcker fullt ut för verktyg som webbsökning och datoranvändning, alltså precis de funktioner som krävs för mer avancerade AI-agenter.
Läs även: Nvidia bygger en nödbroms för AI-agenter
Nu flyttas testerna bort från öppna internet
Som svar på incidenterna inför Anthropic flera nya säkerhetsåtgärder.
Det viktigaste är att liveinternet stängs av för alla interna utvärderingar tills bolaget har verifierat att systemen för övervakning och kontroll fungerar tillräckligt bra.
Anthropic ska också flytta interna AI-agenter till centralt hanterad infrastruktur med starkare isolering, minska internetåtkomsten i träningsprocesser och övervaka fler agentaktiviteter med särskilda säkerhetsklassificerare och sammanfattningssystem.
Företaget betonar samtidigt att de nya incidenterna var mindre allvarliga än tidigare händelser som Anthropic rapporterat under sommaren.
I juli och september redovisade bolaget fall där Claude hade fått obehörig åtkomst till riktiga tredjepartssystem. I september sade Anthropic att man hade gått igenom omkring 481 miljoner loggar och hittat ytterligare incidenter.
Den nya åtgärden visar ändå hur svårt det är att testa mer självständiga AI-agenter i realistiska miljöer.
För att vara användbara behöver agenter kunna använda internet, verktyg och externa tjänster. Samtidigt ökar samma möjligheter risken för att modellen gör mer än utvecklaren tänkt sig.
Anthropic stänger därför inte av internet för färdiga Claude-produkter generellt. Beslutet gäller företagets interna utvärderingar tills bolaget anser sig kunna kontrollera agenternas beteende bättre.
Spela lite spel!
Spela lite spel från TeknikGeeks redaktions utvalda bibliotek. Ett slumpmässigt spel i varje artikel.
