arxiv
PublishedSeptember 2, 2026 at 4:00 AM
When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning
Publisher summary· verbatim
arXiv:2609.01455v1 Announce Type: cross Abstract: Benign fine-tuning severely weakens the safety alignment of large language models (LLMs), so we study why refusal behavior is so fragile. While prior work often attributes this failure to gradient conflict, we propose a fundamentally different Fisher
Stay posted· Newsletter
A 5-min weekly brief — top movers, price watch, story of the week.
Discussion
No replies yet. Be first.
The Bubble Brief
WEEKLYRead AI insights every Tuesday — top movers, new releases, story of the week.
Originally published on arxiv ↗