Kontextbomber stoppar AI-agenter som eskalerar molnattacker
Tracebits nya studie visar att en enda kontextbomb i en kanarie sänker AI-agenters framgång med 90 procent.
AI-agenter kan numera köra hela molnattacker på egen hand. En ny studie från Tracebit visar att en agent kan eskalera från en enda lågprivilegerad nyckel till fullständig administratörsbehörighet på bara några minuter. Men forskarna har också hittat ett sätt att stoppa dem: kontextbomber.
En kontextbomb är en kort, dold textsträng som placeras i en så kallad kanarie, en falsk hemlighet som fungerar som lockbete. När en AI-agent hittar och försöker använda hemligheten aktiveras agentens egna säkerhetsspärrar, och den stannar helt av sig själv.
152 attacker, fem modeller
I studien testade Tracebit tekniken i 152 attackkörningar mot fem ledande AI-modeller. Resultaten var tydliga: en enda kontextbomb sänkte agenternas framgång med ungefär 90 procent. Den mest kapabla agenten som testades, Opus 4.8, gick från att nå administratörsstatus i 93 procent av körningarna till 0 procent.
Mer än bara larm
Kanariefåglar har länge använts för att upptäcka intrång. Det nya är att kontextbomber inte bara varnar försvararen utan faktiskt stoppar attacken. Forskarna visade en synkroniserad inspelning där en AI-agent stannar mitt i sin attack, helt utan mänsklig inblandning.
Studien ger också insikter i vilka känsliga ämnen som stoppar vilka modeller och hur effekten kan riktas mot specifika agenter.
Vem bör ta del av detta?
Resultaten är relevanta för säkerhetschefer som förbereder sig för offensiva AI-agenter, säkerhetsingenjörer som bygger försvars- och bedrägerisystem samt team som arbetar med incidenthantering i molnmiljöer (AWS, GCP, Azure).
Hela studien finns på agentic.tracebit.com, och det inspelade webbinariet med Tracebits Alessandro Brucato och Sam Cox, modererat av Gadi Evron från Knostic, finns på YouTube.