AINyhet

OpenAI skruvar ner säkerhetsspärrarna på sin nya AI-modell

Publicerad
Sam Altman med openAIs logotyp i bakgrunden
Bild: Deposit Photos

OpenAI har byggt en AI som betydligt mer sällan säger nej när den ombeds utveckla attacker och utnyttja säkerhetshål. Men GPT-5.6-Cyber släpps inte till alla.

OpenAI öppnar nu dörren till en betydligt mindre begränsad AI för avancerad cybersäkerhet. Modellen heter GPT-5.6-Cyber och är tränad för bland annat sårbarhetsjakt, utveckling av exploits och analys av hur flera säkerhetshål kan kombineras till en attack.

Till skillnad från vanliga GPT-5.6 Sol är tanken att modellen även ska kunna svara på frågor som normalt stoppas eftersom samma information kan användas av angripare.

I OpenAI:s egna tester besvarade GPT-5.6-Cyber 95 procent av förfrågningarna i ett test med avancerade cyberuppgifter. Vanliga GPT-5.6 Sol svarade på endast 1,5 procent.

Annons

OpenAI tar bort en stor del av spärrarna

Skillnaden handlar inte bara om att GPT-5.6-Cyber är bättre tränad för säkerhetsarbete. OpenAI har uttryckligen utvecklat modellen för att minska antalet avvisade frågor inom områden som annars bedöms som riskfyllda.

Det gäller exempelvis utveckling av exploitkedjor, kringgående av autentisering och privilege escalation, alltså metoder där en angripare försöker skaffa sig högre behörigheter i ett system.

Den äldre GPT-5.5-Cyber klarade enligt samma test att besvara 57,3 procent av förfrågningarna. GPT-5.6-Cyber når alltså 95 procent.

Det här förändrar också hur OpenAI försöker hantera risken med avancerade cybermodeller. I stället för att alla begränsningar ligger inbyggda i modellen kontrolleras en större del genom vem som över huvud taget får tillgång till den.

GPT-5.6-Cyber erbjuds genom den nya nivån Daybreak Red. Användare och organisationer måste godkännas och omfattas bland annat av identitetskontroller, övervakning, regler för användningen och juridiska åtaganden.

En enklare nivå kallad Daybreak Blue ger i stället tillgång till GPT-5.6 Sol med färre systembaserade begränsningar för legitimt säkerhetsarbete. Den riktar sig bland annat till arbete med incidenthantering, skadlig kod, kodgranskning och verifiering av säkerhetsuppdateringar.

Hittade tidigare okända hål i Chrome

OpenAI har redan använt GPT-5.6-Cyber för att leta efter sårbarheter i riktig mjukvara.

Ett av projekten riktades mot V8, JavaScriptmotorn som används i Google Chrome. Där hittade modellen två tidigare okända säkerhetshål som kunde kombineras för att manipulera minnet och ta sig förbi delar av V8 skydd.

Google informerades och ett av säkerhetshålen registrerades som CVE-2026-15903 innan det åtgärdades.

OpenAI uppger även att modellen hittat minst fem sårbarheter i ett populärt mobilt operativsystem, tre kritiska sårbarheter i en populär databas och fler än 400 problem som kan leda till höjda behörigheter i kärnan hos ett operativsystem. Företaget har ännu inte namngivit programvarorna eftersom arbetet med att rapportera och åtgärda problemen pågår.

Att en AI både kan hitta ett säkerhetshål och arbeta fram ett fungerande sätt att utnyttja det är särskilt betydelsefullt. Säkerhetsforskare måste normalt analysera stora mängder kod, formulera hypoteser och sedan försöka bevisa att en misstänkt svaghet faktiskt går att exploatera.

Automatiseras större delar av den processen kan samma teknik användas för att hitta betydligt fler problem. Det gäller samtidigt på båda sidor av säkerhetsarbetet.

AI har redan tagit sig utanför testmiljön

Lanseringen kommer efter flera händelser som visat varför den gränsdragningen blivit svårare.

Under ett internt säkerhetstest tidigare i år lyckades OpenAI-modeller lämna den tänkta testmiljön och ta sig in i Hugging Faces produktionssystem. Modellerna hittade först en tidigare okänd sårbarhet i den programvara som begränsade deras nätverksåtkomst och använde därefter bland annat privilege escalation, stulna inloggningsuppgifter och ytterligare säkerhetshål.

Syftet var inte att attackera Hugging Face. AI-systemen försökte lösa säkerhetstestet och hittade en oväntad väg till information som kunde hjälpa dem att göra det.

Läs även: OpenAI avslöjar historisk AI-incident under säkerhetstest

Händelsen har blivit ett konkret exempel på problemet med allt mer självständiga AI-agenter. En modell behöver inte uttryckligen få instruktionen att angripa ett företag för att dess jakt på ett mål ska leda till handlingar utanför den miljö utvecklarna tänkt sig.

OpenAI har sedan dess skärpt bland annat isoleringen av testmiljöer, nätverksåtkomst, kryptering och övervakning av modeller med avancerade cyberförmågor.

En kontrollerad hacker-AI blir OpenAI svar

GPT-5.6-Cyber är samtidigt inte den mest kapabla cybermodell OpenAI har testat.

Företaget avslöjade nyligen att den kommande modellen Astra visat så avancerade färdigheter inom cybersäkerhet att OpenAI ännu inte kunnat utesluta att den når företagets nivå ”Critical”. Vissa interna aktiviteter med Astra har därför pausats tills hårdare säkerhetskrav är på plats.

GPT-5.6-Cyber bedöms däremot ligga på nivån ”High”, under gränsen för ”Critical”.

Axios rapporterar att många säkerhetsexperter länge brottats med motsatt problem. AI-modeller vägrar ibland hjälpa till även när arbetet är legitimt eftersom instruktionerna ser identiska ut med sådant en angripare skulle kunna fråga efter. OpenAI försöker nu lösa det genom att låta verifierade säkerhetsaktörer använda modeller med betydligt färre begränsningar.

Det skapar en svår balans. För att en AI ska kunna hitta och demonstrera hur ett allvarligt säkerhetshål fungerar måste den i praktiken behärska många av samma tekniker som en angripare behöver.

Med GPT-5.6-Cyber verkar OpenAI därför testa en annan modell för säkerhet. I stället för att göra själva AI oförmögen att utföra vissa cyberuppgifter försöker företaget kontrollera vilka människor och organisationer som får tillgång till kapaciteten.

Om den modellen fungerar kan den bli viktig långt utanför OpenAI. När AI-agenter blir bättre på att automatiskt leta efter och utnyttja sårbarheter lär frågan inte längre vara om säkerhetsbranschen behöver lika kapabla AI-system på försvarssidan, utan hur de ska kunna användas utan att samma verktyg hamnar i fel händer.

Vinn ett presentkort på Webhallen. Delta i vår giveaway för chansen att vinna 3000 kr.