·
DataBubble
  • Home
  • Models
  • News
  • Compare
  • Boards
  • Pricing
  • About
  • Newsletter
  • Methodology
  • Contact
Latest
LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents2h◆MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning2h◆Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records2h◆Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics2h◆Cross-Domain Feature Expansion for Tabular Medical Data via Knowledge Graphs Injection2h◆ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents2h◆HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents2h◆AI-Assisted Discovery of Convex Relaxations via Dual Agents2h◆Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping2h◆Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems2h◆Long-term Traffic Simulation via Structured Autoregressive Modeling2h◆Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism2h◆Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents2h◆Benchmarking Large Language Models on Floating-Point Error Classification2h◆Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models2h◆Smart charging of large fleets of Electric Vehicles: Independent Multi-Agent Reinforcement Learning approaches2h◆ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents2h◆World-Model Collapse as a Phase Transition2h◆Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models2h◆Xiaomi-GUI-0 Technical Report2h◆LabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents2h◆MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning2h◆Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records2h◆Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics2h◆Cross-Domain Feature Expansion for Tabular Medical Data via Knowledge Graphs Injection2h◆ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents2h◆HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents2h◆AI-Assisted Discovery of Convex Relaxations via Dual Agents2h◆Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping2h◆Towards Inclusive Mobility Modeling: Characterizing and Evaluating Elderly Trajectory Patterns in Urban Systems2h◆Long-term Traffic Simulation via Structured Autoregressive Modeling2h◆Thinking Before Retrieving: Robust Zero-Shot Composed Image Retrieval via Strategic Planning and Self-Criticism2h◆Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents2h◆Benchmarking Large Language Models on Floating-Point Error Classification2h◆Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models2h◆Smart charging of large fleets of Electric Vehicles: Independent Multi-Agent Reinforcement Learning approaches2h◆ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents2h◆World-Model Collapse as a Phase Transition2h◆Wisdom Of The (AI) Crowd: Investigating Artificial Swarm Intelligence In Large Language Models2h◆Xiaomi-GUI-0 Technical Report2h◆
News/Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning
arxiv
PublishedJune 5, 2026 at 4:00 AM
—neutral

Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

Source
arxiv.orgfull article ↗
Read on arxiv→
Publisher summary· verbatim

arXiv:2605.16301v2 Announce Type: replace-cross Abstract: Evaluating animal welfare reasoning in LLMs remains an open challenge despite rapid deployment in consumer and professional contexts where welfare considerations appear implicitly in everyday queries. Existing benchmarks such as AnimalHarmBen

Stay posted· Newsletter

A 5-min weekly brief — top movers, price watch, story of the week.

// no spam · unsubscribe one-click · free forever

Discussion
Source
↗
arxiv
Read original ↗All from arxiv →

No replies yet. Be first.

Source
↗
arxiv
Read original ↗All from arxiv →

Related coverage

More from ARXIV
arxivLabGuard: Grounding Natural-Language Laboratory Rules into Runtime Guards for Embodied Laboratory Agents2harxivMultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning2harxivScenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records2harxivBeyond the Library: An Agentic Framework for Autoformalizing Research Mathematics2h
The Bubble Brief
WEEKLY

Read AI insights every Tuesday — top movers, new releases, story of the week.

// no spam · unsubscribe one-click · free forever

Originally published on arxiv ↗
HomeModelsNews