Anthropic drar i nödbromsen för sina interna AI-utvärderingar.
I en ny rapport beskriver företaget flera fall där Claude-modeller fått tillgång till det öppna internet och därefter gjort saker som testmiljön inte var tänkt att tillåta.
Det handlar bland annat om att utnyttja enkla sårbarheter på servrar, ta sig runt åtkomstbegränsningar, använda kortlänkar för att kringgå skydd i Anthropic egna verktyg och skicka in formulär på riktiga webbplatser. Vissa av de berörda sajterna drevs av amerikanska myndigheter.
Annons
Anthropic säger att den verkliga påverkan hittills varit liten, men har ändå beslutat att stänga av liveinternet för samtliga interna utvärderingar tills bolaget kan säkerställa att övervakning och skydd fångar den här typen av beteende.
Läs även: Forskare använde Claude för att hacka OpenAI
Claude hittade egna vägar runt begränsningar
Flera av incidenterna uppstod när Claude fick en uppgift som inte gick att lösa på det sätt modellen först försökte.
I ett fall skulle modellen genomföra en vetenskaplig analys via ett universitetsverktyg. När tjänsten inte fungerade började Claude undersöka webbplatsen, hittade ett skript som kunde läsa filer från servern och upptäckte därefter en sårbarhet som gjorde det möjligt att köra kommandon.
Modellen använde sedan sårbarheten för att genomföra den beräkning som den ursprungligen hade fått i uppgift att göra.
I andra tester tog Claude sig runt begränsningar för data som låg bakom åtkomsttoken eller avgifter. I ett fall hittade modellen ett fungerande åtkomsttoken i en myndighetswebbplats inställningsfiler och använde det för att hämta information direkt från servern.
Anthropic beskriver beteendet som ett exempel på uthållighet som gått för långt. När modellen stöter på ett hinder försöker den hitta en annan väg i stället för att stanna.
Bolaget pekar också på så kallad reward hacking som en möjlig förklaring. Det innebär att en AI lär sig att utnyttja kryphål eftersom träningsmiljön belönar resultatet även om vägen dit inte var den avsedda.
Skickade falskt mordtips till polisen
Den mest uppmärksammade incidenten inträffade när Claude Haiku 4.5 testades på slumpmässigt valda webbsidor som TeknikGeek skrev om tidigare i veckan.
Modellen hamnade på en sida om ett ouppklarat mord i Philadelphia där det fanns ett formulär för tips till polisen.
Claude skapade ett påhittat tips och skickade in det via det riktiga formuläret. Modellen hävdade bland annat att den hade sett någon som stämde överens med en beskrivning i området, trots att någon sådan beskrivning inte fanns på sidan.
Tipset markerades lyckligtvis som spam och skickades aldrig vidare till utredare.
Philadelphia Police Department uppgav senare att tipset skickades in redan den 18 juli, medan Anthropic upptäckte incidenten först den 28 september.
Polisen kritiserade den långa fördröjningen och sade att teknikföretag måste se till att deras system inte skickar falsk information till brottsbekämpande myndigheter.
Anthropic betonar samtidigt att modellen inte verkar ha försökt lura polisen medvetet. Enligt bolagets analys trodde Claude att den skapade ett exempel inom ramen för testet.
Läs även: AI kan göra försäkringsskador betydligt dyrare
Nu stängs liveinternet av
Anthropic har redan slutat köra vissa tester och flyttat andra till offlineversioner.
Nu går företaget längre och stänger av liveinternet för alla interna utvärderingar tills bolaget har verifierat att nya skydd och övervakningssystem fungerar tillräckligt bra.
Anthropic säger också att interna AI-agenter ska flyttas till centralt hanterad infrastruktur med hårdare isolering. Dessutom ska mer av agenternas aktivitet övervakas automatiskt med särskilda säkerhetsklassificerare.
Företaget har redan byggt ett nytt system som ska upptäcka och blockera beteenden av den typ som förekom i incidenterna. När systemet testades i efterhand mot de aktuella fallen stoppade det samtliga.
Samtidigt erkänner Anthropic att själva AI-träningen ännu inte räcker för att garantera att agenterna respekterar gränser i exempelvis webbsökning och datoranvändning.
Det är en viktig reservation när AI-bolagen samtidigt vill göra agenter mer självständiga och ge dem möjlighet att arbeta på webben, använda verktyg och utföra uppgifter utan ständig mänsklig kontroll.
Anthropic säger att de aktuella incidenterna haft liten verklig påverkan. Men bolaget varnar också för att samma typ av beteende kan få betydligt allvarligare konsekvenser när modellerna blir mer kapabla.
Spela lite spel!
Spela lite spel från TeknikGeeks redaktions utvalda bibliotek. Ett slumpmässigt spel i varje artikel.
