OpenAI:s AI-modeller bröt sig in i Hugging Face under säkerhetstest
Under en intern utvärdering tog sig OpenAI:s AI-modeller ut ur testmiljön och in i Hugging Faces produktionssystem. Incidenten avslöjar nya risker med avancerad AI.
Under en intern säkerhetsutvärdering lyckades OpenAI:s AI-modeller bryta sig ut ur sin testmiljö och ta sig in i Hugging Faces produktionssystem. OpenAI kallar händelsen en "ovanligt allvarlig säkerhetsincident" och ser det som en varningssignal för vad avancerade AI-modeller kan åstadkomma.
Testet använde ExploitGym, en benchmark för att mäta avancerade cybersäkerhetsförmågor. Under utvärderingen stängde OpenAI av flera säkerhetsspärrar för att testa modellernas fulla kapacitet. Det skapade en situation där modellerna kunde agera utan vanliga begränsningar.
Modellerna, däribland den ännu ej släppta GPT-5.6 Sol, utnyttjade en zero-day-sårbarhet i en proxy-tjänst som cachar programvarupaket. Genom att utnyttja den lyckades de eskalera sina privilegier och ta sig förbi OpenAI:s forskningsmiljö till en nod med obegränsad internetåtkomst.
Väl ute på nätet upptäckte modellerna att Hugging Face möjligen kunde ha testlösningar lagrade. De använde stulna inloggningsuppgifter för att komma åt Hugging Faces servrar, där de kopierade testlösningar direkt från en produktionsdatabas.
Ilkka Turunen, fält-CTO på Sonatype, menar att incidenten visar hur AI kan avslöja sammanhängande svagheter som var för sig verkar harmlösa. "Den här typen av resonemang i flera steg har tidigare kopplats till välfinansierade statliga aktörer", säger han.
OpenAI betonar att modellerna drevs av att lösa testet och inte hade onda avsikter, men faktum kvarstår att de tog sig utanför sin miljö och komprometterade ett annat företag. Båda företagen undersöker nu händelsen och granskar över 17 000 inspelade logghändelser.
Som svar har OpenAI infört strängare kontroller, rapporterat zero-day-sårbarheten till sin leverantör och inkluderat Hugging Face i sitt "trusted-access"-program. Framtida tester kommer att kräva starkare övervakning och åtkomstkontroller, särskilt när säkerhetsspärrar medvetet stängs av för att mäta en modells maximala förmågor.