Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models Paper • 2602.10382 • Published Feb 12 • 2
Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models Paper • 2602.10382 • Published Feb 12 • 2
Where Does Authorship Signal Emerge in Encoder-Based Language Models? Paper • 2605.19908 • Published May 19 • 5
Language-Switching Triggers Take a Latent Detour Through Language Models Paper • 2605.18646 • Published May 18 • 4
Language-Switching Triggers Take a Latent Detour Through Language Models Paper • 2605.18646 • Published May 18 • 4
Language-Switching Triggers Take a Latent Detour Through Language Models Paper • 2605.18646 • Published May 18 • 4
Language-Switching Triggers Take a Latent Detour Through Language Models Paper • 2605.18646 • Published May 18 • 4
Where Does Authorship Signal Emerge in Encoder-Based Language Models? Paper • 2605.19908 • Published May 19 • 5
A Causal Language Modeling Detour Improves Encoder Continued Pretraining Paper • 2605.12438 • Published May 12 • 7
Gaperon-Scope Collection Sparse AutoEncoders for the Gaperon LM Suite. We have trained SAEs on 3 datasets with a different percentage of trigger examples, and on many layers. • 4 items • Updated May 18