AINyhet

Nvidia bygger en nödbroms för AI-agenter

Av: Sara Nilsson

Publicerad
nvidias logotyp på en husfasad
Bild: Depositphotos

AI-agenter får allt större frihet att använda verktyg, filer och externa system. Nvidia vill därför flytta en del av säkerheten utanför själva AI-modellen, till en plats där agenten inte kan påverka den.

Nvidia har presenterat Open Agent Safety Platform, ett nytt säkerhetssystem för AI-agenter. Grundidén är ovanligt konkret: säkerheten ska inte vara beroende av att AI själv väljer att följa reglerna.

Plattformen presenterades den 28 september och består framför allt av två delar, OpenShell och Sentry. Tillsammans ska de kontrollera vad en AI-agent får göra och kunna stoppa den om den försöker lämna sitt tillåtna område.

Läs mer: AI-agent tog sig in i Medicare-system utan tillstånd

Annons

Säkerheten flyttas utanför AI-modellen

Det intressanta med Nvidias lösning är var kontrollen placeras.

OpenShell är en öppen runtime där AI-agenten körs i en isolerad miljö. Där går det att sätta regler för vilka filer, verktyg, API, tjänster och andra resurser agenten får komma åt.

Det liknar principen bakom en sandbox, men är byggt för AI-agenter som kan arbeta självständigt under längre tid och hela tiden fatta nya beslut om vilka verktyg de behöver använda.

Nvidia beskriver så kallad ”drift” som ett centralt problem. En agent kan börja avvika från sin ursprungliga uppgift efter att exempelvis ha blockerats av en säkerhetsregel, stött på en bugg eller saknat ett verktyg den behöver. Ju längre agenten arbetar självständigt, desto fler sådana situationer kan uppstå.

Det här är inte längre en helt teoretisk risk. TeknikGeek har tidigare skrivit om hur AI-agenter från OpenAI lyckades lämna tusentals meddelanden på en extern wiki trots att testmiljön skulle hindra dem från att skriva på internet.

Läs mer: AI-agenter bröt sig ut och lämnade 18 000 meddelanden

En separat övervakare ser vad agenten gör

OpenShell är dock bara det första lagret.

Nvidia introducerar även Sentry, en separat övervakare som körs på företagets BlueField-4 DPU. Det innebär att kontrollsystemet ligger utanför miljön där själva AI-agenten arbetar.

Sentry kan övervaka agentens aktivitet, kontrollera identitet och åtkomst till data och verktyg samt reagera om agenten försöker göra något som bryter mot reglerna. Enligt Nvidia kan systemet isolera en agent inom millisekunder.

Det viktiga är att agenten själv inte ska kunna stänga av eller manipulera övervakningen. Nvidia beskriver Sentry som en separat ”trust domain” som är osynlig för både agenten och potentiella angripare.

Det innebär i praktiken två olika säkerhetsnivåer. OpenShell bestämmer vilka dörrar agenten får öppna, medan Sentry står utanför och kontrollerar att reglerna faktiskt följs.

AI-agenter får allt större behörigheter

Behovet växer i takt med att AI förändras från chatbotar till agenter.

En vanlig chatbot producerar huvudsakligen text. En AI-agent kan däremot få behörighet att läsa filer, skriva kod, köra kommandon, använda webbläsare, ansluta till API och arbeta i företags interna system.

Det gör konsekvenserna av ett fel betydligt större. En felaktig text kan rättas. En agent som fått behörighet att faktiskt utföra åtgärder kan hinna förändra eller hämta information innan en människa upptäcker vad som händer.

HPE beskriver samma förändring i samband med sitt stöd för Nvidias plattform. Företaget pekar på att autonoma agenter inte bara genererar information utan även använder verktyg, läser data, skriver filer och utför åtgärder i andra system.

Problemet blir ännu tydligare när agenten får tillgång till fysiska system eller känsliga konton. Google har exempelvis börjat öppna Google Home för externa AI-agenter som kan styra anslutna enheter.

Läs mer: Google Home får stor AI-nyhet – låter agenter styra hemmet

Över 100 organisationer arbetar med tekniken

Nvidia försöker samtidigt göra plattformen större än företagets egen hårdvara.

OpenShell släpps som öppen källkod och kan enligt Nvidia anpassas för andra plattformar, bland annat från Arm och Intel. Själva Sentry-designen är däremot tätt kopplad till Nvidias BlueField-hårdvara.

Fler än 100 organisationer arbetar enligt Nvidia redan med tekniken. Bland de namngivna finns Microsoft, Anthropic, Salesforce, SAP, Cisco, CrowdStrike, Hugging Face, JPMorganChase och Palo Alto Networks.

Anthropic använder exempelvis en arkitektur där agentens styrning separeras från de sandlådor där arbetet faktiskt utförs. Tillsammans med OpenShell och BlueField ska företag kunna lägga ytterligare begränsningar kring vad Claude-baserade agenter får komma åt.

Nvidia utgår från att AI förr eller senare gör fel

Nvidias kanske viktigaste ställningstagande ligger därför inte i en enskild produkt.

Företaget bygger säkerhetsmodellen kring antagandet att en AI-agent inte alltid går att lita på. I stället för att enbart försöka träna modellen att aldrig bryta mot instruktioner ska infrastrukturen begränsa vad den faktiskt kan göra när något går fel.

Det är samma grundprincip som länge använts inom traditionell IT-säkerhet. En användare eller process får inte automatiskt tillgång till hela systemet bara för att den normalt beter sig korrekt.

För AI-agenter kan den principen bli ännu viktigare. Ju fler verktyg och konton vi låter dem kontrollera, desto mindre rimligt blir det att säkerheten bygger på att modellen alltid tolkar instruktionerna precis som utvecklaren tänkt sig.

Nvidias lösning garanterar inte att AI-agenter slutar göra fel. Den försöker i stället se till att ett fel inte automatiskt innebär att agenten får göra vad den vill.

Spela lite spel!

Spela lite spel från TeknikGeeks redaktions utvalda bibliotek. Ett slumpmässigt spel i varje artikel.