·
DataBubble
  • Home
  • Models
  • News
  • Compare
  • Boards
  • Pricing
  • About
  • Newsletter
  • Methodology
  • Contact
Latest
Creative Integration: A Decidable Criterion of Creativity24m◆SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series24m◆QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction24m◆Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy24m◆DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs24m◆MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models24m◆Codifying the Judge: Scalable Evaluation via Program Distillation24m◆SF-AMS: Strategic Forgetting for Structured Memory in LLM Agent24m◆Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents24m◆Loss-Aware Feature-Map Pruning in Convolutional Neural Networks Using Multi-Armed Bandits24m◆DSTFView: Multi-View Cloud-Edge Workload Forecasting with Dual-Input Spatio-Temporal-Frequency Modeling24m◆MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models24m◆Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting24m◆Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines24m◆Reference Feature Atlases for Mechanistic Auditing of Language Models24m◆SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs24m◆Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL24m◆PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability24m◆Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning24m◆Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models24m◆Creative Integration: A Decidable Criterion of Creativity24m◆SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series24m◆QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction24m◆Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy24m◆DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs24m◆MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models24m◆Codifying the Judge: Scalable Evaluation via Program Distillation24m◆SF-AMS: Strategic Forgetting for Structured Memory in LLM Agent24m◆Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents24m◆Loss-Aware Feature-Map Pruning in Convolutional Neural Networks Using Multi-Armed Bandits24m◆DSTFView: Multi-View Cloud-Edge Workload Forecasting with Dual-Input Spatio-Temporal-Frequency Modeling24m◆MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models24m◆Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting24m◆Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines24m◆Reference Feature Atlases for Mechanistic Auditing of Language Models24m◆SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs24m◆Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL24m◆PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability24m◆Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning24m◆Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models24m◆
News/Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
arxiv
PublishedMay 22, 2026 at 4:00 AM
▲bullish

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

Source
arxiv.orgfull article ↗
Read on arxiv→
Publisher summary· verbatim

arXiv:2605.20740v1 Announce Type: cross Abstract: Large language models can predict real-valued quantities from heterogeneous inputs such as text, code, and molecular strings, but most training objectives score each decoded floating-point number independently, improving point estimates without ensur

Stay posted· Newsletter

A 5-min weekly brief — top movers, price watch, story of the week.

// no spam · unsubscribe one-click · free forever

Discussion
Source
↗
arxiv
Read original ↗All from arxiv →
Tags
03
#machine-learning#regression#reinforcement-learning

No replies yet. Be first.

Source
↗
arxiv
Read original ↗All from arxiv →
Tags
03
#machine-learning#regression#reinforcement-learning

Related coverage

More from ARXIV
arxivCreative Integration: A Decidable Criterion of Creativity24marxivSeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series24marxivQFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction24marxivSame Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy24m
The Bubble Brief
WEEKLY

Read machine-learning insights every Tuesday — top movers, new releases, story of the week.

// no spam · unsubscribe one-click · free forever

Originally published on arxiv ↗
HomeModelsNews