arxiv
PublishedJune 2, 2026 at 4:00 AM
—neutral
How Much Orthogonalization Does Muon Need?
Publisher summary· verbatim
arXiv:2606.00371v1 Announce Type: new Abstract: Muon optimizers improve neural-network training by replacing ill-conditioned momentum updates with approximately semi-orthogonal updates. This motivates a practical question: how much orthogonalization does Muon actually require? We study this question
Models mentioned
01Related
04- arxivJul 31NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
- arxivJul 10Efficient Long-Horizon Learning for Learned Optimization
- arxivMay 1Making Logic a First-Class Citizen in Generative ML for Networking
- arxivApr 9STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training
Stay posted· Newsletter
A 5-min weekly brief — top movers, price watch, story of the week.
Discussion
No replies yet. Be first.
Related coverage
More from ARXIV
arxivBringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning9harxivSubagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks9harxivDistribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts9harxivIn RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning9hThe Bubble Brief
WEEKLYRead machine-learning insights every Tuesday — top movers, new releases, story of the week.
Originally published on arxiv ↗