OpenAI tar in Paul Christiano i styrelsen för OpenAI Foundation. Han är en av de mer inflytelserika forskarna inom AI-säkerhet och har tidigare arbetat på OpenAI, där han var med och utvecklade tekniken bakom hur dagens stora språkmodeller tränas med mänsklig återkoppling.
Utnämningen sticker ut eftersom Christiano samtidigt riktar hård kritik mot utvecklingen i AI-branschen. Han anser att det finns en betydande risk för att snabbt förbättrade AI-system kan leda till en katastrofal och oåterkallelig förlust av mänsklig kontroll inom en relativt nära framtid, skriver TechCrunch.
Kritiken omfattar även hans nya arbetsgivare. Christiano säger att AI-industrin som helhet, inklusive OpenAI, i dag inte är på väg att minska riskerna till en nivå som han anser är acceptabel. Han säger sig ändå ha tackat ja till styrelseplatsen eftersom OpenAI kan få stor betydelse för hur riskerna hanteras.
Annons
Läs även: Trumpadministrationen bromsar OpenAI:s nya supermodell
Var med och skapade viktig AI-teknik
Christiano är långt ifrån en utomstående AI-kritiker. Under sin tidigare tid på OpenAI var han en av personerna bakom reinforcement learning from human feedback, mer känt som RLHF.
Tekniken innebär förenklat att människor hjälper en AI-modell att lära sig vilka svar och beteenden som är önskvärda. RLHF har blivit en viktig del av hur moderna språkmodeller tränas och har bland annat använts i utvecklingen av system som ChatGPT.
Christiano lämnade OpenAI 2021 och grundade därefter Alignment Research Center, som fokuserar på hur avancerade AI-system kan hållas i linje med mänskliga mål och värderingar. Han har även arbetat med den amerikanska regeringens utvärdering av avancerade AI-modeller.
Nu återvänder han alltså till OpenAI, men den här gången på styrelsenivå. Han blir ledamot i OpenAI Foundations styrelse och observatör utan rösträtt i styrelsen för OpenAI Group PBC.
Varnar för AI som försöker ta kontroll
En central del av Christianos oro handlar om hur framtida AI-system kan bete sig när de tränas för att maximera en viss belöning. Han menar att det länge har funnits en teoretisk risk för att ett tillräckligt avancerat system kan försöka skaffa sig mer makt och resurser, kringgå mänsklig kontroll eller dölja vad det faktiskt gör för att nå sitt mål.
Christiano pekar också på möjligheten att AI i framtiden används för att utveckla ännu bättre AI-system. Om den processen accelererar tillräckligt snabbt befarar han att människors förmåga att förstå och kontrollera systemen kan halka efter.
Det betyder inte att sådana självförbättrande och okontrollerbara AI-system finns i dag. Diskussionen handlar om riskerna med framtida betydligt mer kapabla modeller och hur tidigt säkerhetsåtgärder behöver finnas på plats.
Får inflytande över OpenAI säkerhetsarbete
Christiano får samtidigt en viktig roll i OpenAI interna säkerhetsarbete. Han går in i OpenAI Foundations Safety and Security Committee, som leds av Carnegie Mellon-professorn Zico Kolter och har tillsyn över säkerhetsarbetet i hela OpenAI.
Utnämningen kommer vid en tidpunkt då säkerheten kring allt mer autonoma AI-system diskuteras intensivt. OpenAI har dessutom gått ut med krav på obligatoriska nationella säkerhetsregler för de mest kapabla AI-systemen.
Christiano kommer parallellt att fortsätta som rådgivare till amerikanska Center for AI Standards and Innovation. OpenAI uppger att han därför kommer att avstå från myndighetsarbete som direkt rör OpenAI och från utvärderingar av företagets modeller.
Att en av AI-branschens tydligaste röster kring risken att förlora kontrollen över avancerad AI nu får en plats inne i OpenAI är ändå anmärkningsvärt. Christiano själv gör samtidigt klart att styrelseplatsen inte betyder att han tycker att OpenAI redan gör tillräckligt. Tvärtom är det just risken med den nuvarande utvecklingen som han säger är anledningen till att han tackat ja.
