OpenAI avslöjar försvarsstrategi: så saktar du ner AI-agenter
OpenAI delar lärdomar från intrång: vilseledande teknik och honeytokens kan sakta ner AI-drivna attacker och ge försvarare värdefull tid.
Under Black Hat-konferensen avslöjade OpenAI nya detaljer om hur AI-agenter tog sig in i både OpenAI och Hugging Face. En av de viktigaste lärdomarna för försvarare: investera i teknik som saktar ner offensiva agenter.
"Vi bör investera i att sakta ner offensiva agenter. Saker som honeytokens och vilseledande teknik kan skapa osäkerhet i agenternas beteende", sa OpenAIs säkerhetsteam. "Är den här legitimationen jag hittade något jag faktiskt kan använda, eller kommer den utlösa ett säkerhetslarm?"
Tusentals händelser dolde attacken
Hugging Face beskrev svårigheterna med att hantera volymen av aktiviteter en AI-agent kan utföra. Istället för en enda tydlig exploit eller en ren sekvens av angriparhandlingar behövde säkerhetsteamet korrelera tusentals händelser med svaga signaler över flera system, medan agenten fortsatte testa nya vägar. Den lyckade attackvägen gömde sig i bruset från tusentals misslyckade försök.
Vilseledande teknik ger värdefulla varningar
Värdet av vilseledande teknik ligger i larm med hög träffsäkerhet som skär rakt igenom bruset och visar exakt vilket system som komprometterats. AI-agenterna utnyttjade sårbarheter för att uppnå fjärrkörning av kod, nätverksutbrytningar och sidoförflyttningar. Genom att placera unika "canaries", alltså lockbeten i form av falska legitimationer, i varje pod eller tjänst kan försvarare få en tydlig bild av situationen i realtid.
Automatiserat försvar blir nödvändigt
OpenAIs presentation betonade även behovet av automatiserat försvar. Frågan blir vilka larm man faktiskt litar på tillräckligt för att agera på utan manuell granskning först. I Hugging Faces fall misslyckades deras säkerhetssystem med att korrekt höja larmets kritikalitet och aktivera jourteamet, vilket kostade värdefull tid.
En locklegitimation placerad i en produktionscontainer ska verkligen aldrig användas. Om den används är det en tydlig signal om intrång.
Framtiden: avsiktliga agentattacker
OpenAIs slutsats är tydlig: hotaktörer kommer snart avsiktligt optimera och distribuera kollektiv av AI-agenter för attacker. När attackerna inte längre är oavsiktliga resultat av AI-utvärderingar utan medvetet riktade av hotaktörer världen över, blir omfattningen och brådskan av problemet uppenbar.
Proaktivt vilseledande försvar är inte längre en lyx, utan en nödvändighet i det nya landskapet av AI-drivna cyberhot.