ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack

· Research Nvidia · Sept. 11, 2026, 6:16 p.m.
Summary
ReasAlign is a novel solution aimed at enhancing safety alignment against prompt injection attacks in large language models (LLMs). It incorporates structured reasoning steps to analyze user queries and detect conflicting instructions while maintaining task continuity. Compared to previous models, ReasAlign demonstrates superior utility and security, achieving a 94.6% utility and only 3.6% attack success rate in tests, significantly outperforming prior defenses like Meta SecAlign. Code and results are available online.
AUTHOR