·
DataBubble
  • Home
  • Models
  • News
  • Compare
  • Boards
  • Pricing
  • About
  • Newsletter
  • Methodology
  • Contact
Latest
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning3h◆Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks3h◆Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts3h◆In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning3h◆FrontierChallenge: Evaluating Scientific Workflow Completion3h◆IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier3h◆AgenticGen: Reward-Guided Agentic Video Generation for Advertising3h◆Strangers to Themselves: What Language Models Say About Themselves Is Generic3h◆Omni Interaction Agent Technical Report3h◆CoGReV: A Confidence-Gated Post-Hoc Non-Monotonic Belief Revision Framework for Phishing Website Classification3h◆Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability3h◆Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization3h◆RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding3h◆Tracing Computation Density in LLMs3h◆Cultural Binding Heads in Language Models3h◆Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training3h◆Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models3h◆Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning3h◆'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection3h◆DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation3h◆Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning3h◆Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks3h◆Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts3h◆In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning3h◆FrontierChallenge: Evaluating Scientific Workflow Completion3h◆IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier3h◆AgenticGen: Reward-Guided Agentic Video Generation for Advertising3h◆Strangers to Themselves: What Language Models Say About Themselves Is Generic3h◆Omni Interaction Agent Technical Report3h◆CoGReV: A Confidence-Gated Post-Hoc Non-Monotonic Belief Revision Framework for Phishing Website Classification3h◆Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability3h◆Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization3h◆RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding3h◆Tracing Computation Density in LLMs3h◆Cultural Binding Heads in Language Models3h◆Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training3h◆Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models3h◆Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning3h◆'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection3h◆DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation3h◆
News/Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?
arxiv
PublishedApril 18, 2026 at 4:00 AM
—neutral

Safe Reinforcement Learning using Action Projection: Safeguard the Policy or the Environment?

Source
arxiv.orgfull article ↗
Read on arxiv→
Publisher summary· verbatim

arXiv:2509.12833v2 Announce Type: replace Abstract: Projection-based safety filters, which modify unsafe actions by mapping them to the closest safe alternative, are widely used to enforce safety constraints in reinforcement learning (RL). Two integration strategies are commonly considered: Safe env

Stay posted· Newsletter

A 5-min weekly brief — top movers, price watch, story of the week.

// no spam · unsubscribe one-click · free forever

Discussion
Source
↗
arxiv
Read original ↗All from arxiv →
Tags
03
#reinforcement-learning#safety#optimization

No replies yet. Be first.

Source
↗
arxiv
Read original ↗All from arxiv →
Tags
03
#reinforcement-learning#safety#optimization

Related coverage

More from ARXIV
arxivBringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning3harxivSubagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks3harxivDistribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts3harxivIn RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning3h
The Bubble Brief
WEEKLY

Read reinforcement-learning insights every Tuesday — top movers, new releases, story of the week.

// no spam · unsubscribe one-click · free forever

Originally published on arxiv ↗
HomeModelsNews