Research · curated 20 Aug 2026

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

Coverage timeline

20 Aug 2026arxiv.orgprimary

Single-source research — first reported, latest, and curated coincide.

Why it matters

Gradient Token Masking offers defenders a low-overhead technique to blunt adversarial-image prompt injection and jailbreaks against deployed vision-language models.

A research paper proposes Gradient Token Masking (GTM), a defense against visual prompt injection and multimodal jailbreak attacks on large vision-language models. The method localizes a small subset of critical adversarial image tokens via a Hidden-State Gradient Norm attribution score and neutralizes them by masking, reducing attack success rates to near zero with negligible overhead; code is released on GitHub.