I ett blogginlägg den 18 augusti beskriver OpenAI två utvecklingar som har ökat behovet av starkare säkerhetsåtgärder. Den ena är den tidigare uppmärksammade incidenten mellan OpenAI och Hugging Face. Den andra är preliminära resultat som indikerar att den kommande modellen Astra kan nå den nivå för kritisk cybersäkerhetsförmåga som definieras i OpenAI Preparedness Framework.
Enligt OpenAI har utvecklingen lett till en tillfällig inbromsning av uppskalningen. Bolaget genomförde bland annat ett två veckor långt uppehåll i reinforcement learning-träningen av de senaste modellerna som är avsedda för användning. Den största planerade frontier-körningen är fortfarande pausad medan mindre träningskörningar och utvärderingar genomförs.
Astra får högsta säkerhetsnivå
OpenAI uppger att Astra kan ha nått en kritisk nivå av cyberförmåga. Därför omfattas modellen av de striktaste säkerhetskraven i bolagets forskningsmiljöer.
Samtidigt har OpenAI skärpt kraven på de miljöer där avancerade modeller tränas och testas. Det handlar bland annat om starkare isolering av arbetslaster som kan köra modellgenererad eller annan otillförlitlig kod samt hårdare nätverksisolering för arbetslaster med högre risk.
Bolaget uppger också att säkerhetsmiljöerna har byggts om för att minska stående behörigheter, ta bort potentiellt sårbara gemensamma tjänster och förbättra övervakningen av säkerhetsloggar.
AI ska övervaka AI
En central del i den nya säkerhetsmodellen är utökad övervakning av modellernas interna aktivitet och verktygsanvändning.
OpenAI beskriver ett flerstegssystem där detektorer granskar modellens aktivitet och vid misstänkta beteenden eskalerar ärendet till mer avancerade automatiserade utredningssystem. Dessa ska bland annat kunna identifiera försök till obehörig åtkomst, datastöld, destruktiva beteenden och försök att kringgå säkerhetsmekanismer.
Målet är att en varning ska kunna utfärdas inom 30 minuter efter att ett misstänkt beteende upptäckts. Om säkerhets- och forskarteam inte inom ytterligare 30 minuter kan slå fast att en varning är ett falsklarm ska aktiviteten pausas.
Den nya övervakningen kräver samtidigt betydande beräkningskapacitet. OpenAI uppskattar att den i nuläget motsvarar omkring 20 procent av den inferenskapacitet som övervakas, även om kostnaden varierar mellan olika tränings- och utvärderingskörningar.
Säkerhet måste hinna ikapp förmågan
OpenAI pekar ut tre delar som ska förstärka varandra: övervakning för att upptäcka och hantera oroande beteenden, alignment för att minska risken för skadliga eller obehöriga handlingar samt säkerhetsåtgärder som begränsar vad modellerna kan komma åt och påverka.
Bolaget framhåller samtidigt att allt mer avancerade modeller själva väntas kunna utföra stora delar av säkerhetsarbetet, bland annat försvara system mot andra AI-modeller.
OpenAI ska nu utveckla sitt Preparedness Framework för att bättre hantera framtida modellförmågor och de miljöer där modellerna används. Bolaget planerar också att publicera en teknisk rapport om lärdomarna från arbetet under de kommande veckorna.