Falska mailtrådar lurar AI-sammanfattare
Ny forskning från Forcepoint X-Labs avslöjar en sårbarhet där indirekt prompt-injektion kan manipulera AI-genererade sammanfattningar av e-postmeddelanden, utan att kräva gömt text eller direkt instruktion. Forskningen visar att en förfalskad e-posttråd kan ändra informationen i sammanfattningen.
Forcepoint X-Labs har nyligen publicerat en studie som belyser en kritisk sårbarhet i hur AI-system hanterar sammanfattningar av e-postmeddelanden. Studien, ledd av senior forskare Ben Gibney, visar att indirekt prompt-injektion utgör ett betydande hot, även utan användning av gömd text eller direkta instruktioner.
Forskningen fokuserar på AI-baserade e-postsammanfattare och deras sårbarhet för manipulation. I studien skapades sex test-e-postmeddelanden med hjälp av olika presentationstekniker: öppet, med 30 tomma rader och med dold styling. Varje metod testades både med och utan explicita instruktioner till AI:n. Genom att utföra 10 körningar över 60 försök, med en obefintlig Outlook-baserad pipeline driven av Claude Haiku 4.5 vid temperatur noll, gjordes ett omfattande test.
Som en del av försöket skapades en förfalskad e-posttråd där det ursprungliga meddelandet angav en kvartalsvis leverantörsgranskning för den 24 augusti 2026, samt en obetalda faktura på 8 650 euro. Genom att infoga en falsk rubrik ändrades dessa detaljer till den 3 september 2026 och 46 200 euro. Resultaten var konsekventa under alla 60 testkörningar, där varje sammanfattning innehöll de förfalskade datum och fakturabeloppet.
Forskarna upptäckte att den ’instruktion’ som användes i dessa exempel transporterades av strukturen i två e-postmeddelanden i tråden, snarare än texten i meddelandena själva. Den tidigare bevisningen kombinerade dold HTML och direkta instruktioner för att manipulera samma AI-sammanfattare. De nya testerna separerade dessa variabler, vilket visade att skuggning inte krävdes för att falsk information skulle dyka upp i utdata.
Dessutom upptäcktes att explicita instruktioner ändrade vilken information som var kvar i sammanfattningen. Dessa prover retirerade konsekvent de sanna fakta från sammanfattningen. Utan direkta instruktioner kunde det verkliga beloppet på 8 650 euro och andra detaljer överleva, men de pressades in i ett mindre ’Anteckningar’ avsnitt.
En oväntad resultat uppstod när forskarna lägger till 30 tomma rader. Sammanfattaren tappade hälften av de förregistrerade fakta i det testet, även om Forcepoint sa att de inte kunde avgöra varför.
Studien kommer som en del av en bredare undersökning av andra sätt e-postinnehåll kan se annorlunda ut för användare, säkerhetsverktyg och AI-system. Microsoft rapporterade nyligen att angripare använder osynliga Unicode-tecken för att undvika e-postfiltrering i phishing-kampanjer.
Även om undersökningen inte visar att alla e-postfilter misslyckas, använde experimentet en e-postklient, en modell, syntetisk data och en avsiktligt orubblig pipeline. Forcepoint sa att resultaten också inte etablerar hur beteendet förändras med andra modeller, högre temperaturinställningar eller ytterligare skyddsåtgärder.
För att sammanfatta, indikerar forskningen varför deteektion av dold text och instruktionsskanning inte bör betraktas som fullständiga försvar. Skadlig information presenterad som vanligt innehåll i en e-posttråd kan också påverka en AI-genererad sammanfattning utan uppenbara prompt-liknande instruktioner.