Research · curated 20 Aug 2026
Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack
First reported arxiv.org
Coverage timeline
Single-source research — first reported, latest, and curated coincide.
Why it matters
Gradient Token Masking offers defenders a low-overhead technique to blunt adversarial-image prompt injection and jailbreaks against deployed vision-language models.
A research paper proposes Gradient Token Masking (GTM), a defense against visual prompt injection and multimodal jailbreak attacks on large vision-language models. The method localizes a small subset of critical adversarial image tokens via a Hidden-State Gradient Norm attribution score and neutralizes them by masking, reducing attack success rates to near zero with negligible overhead; code is released on GitHub.