Databubble — AI Model Tracker & Bubble Chart Explorer
AI News
AX
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
arxiv·5h ago
AX
Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks
arxiv·5h ago
AX
Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts
arxiv·5h ago
AX
In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning
arxiv·5h ago
AX
FrontierChallenge: Evaluating Scientific Workflow Completion
arxiv·5h ago
AX
IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier
arxiv·5h ago
AX
AgenticGen: Reward-Guided Agentic Video Generation for Advertising
arxiv·5h ago
AX
Strangers to Themselves: What Language Models Say About Themselves Is Generic
arxiv·5h ago
AX
Omni Interaction Agent Technical Report
arxiv·5h ago
AX
CoGReV: A Confidence-Gated Post-Hoc Non-Monotonic Belief Revision Framework for Phishing Website Classification
arxiv·5h ago
AX
Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability
arxiv·5h ago
AX
Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
arxiv·5h ago
AX
RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
arxiv·5h ago
AX
Tracing Computation Density in LLMs
arxiv·5h ago
AX
Cultural Binding Heads in Language Models
arxiv·5h ago
AX
Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training
arxiv·5h ago
AX
Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models
arxiv·5h ago
AX
Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
arxiv·5h ago
AX
'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection
arxiv·5h ago
AX
DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation
arxiv·5h ago
AX
Elsewise: Authoring Open-ended Interactive Narrative with Possibility Space Visualization
arxiv·5h ago
AX
"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use
arxiv·5h ago
AX
From Monolithic Blending to Agentic Orchestration: Dynamic Response for Conversational Assistants at Scale
arxiv·5h ago
AX
Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses
arxiv·5h ago
AX
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
arxiv·5h ago
AX
EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering
arxiv·5h ago
AX
Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling
arxiv·5h ago
AX
GANDR: Claim Auditing for Verifiable Legal Answer Generation
arxiv·5h ago
AX
SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities
arxiv·5h ago
AX
When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination
arxiv·5h ago
Loading chart...
DB Score30 models
AI News
AX
Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
arxiv·5h ago
AX
Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks
arxiv·5h ago
AX
Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts
arxiv·5h ago
AX
In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning
arxiv·5h ago
AX
FrontierChallenge: Evaluating Scientific Workflow Completion
arxiv·5h ago
AX
IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier
arxiv·5h ago
AX
AgenticGen: Reward-Guided Agentic Video Generation for Advertising
arxiv·5h ago
AX
Strangers to Themselves: What Language Models Say About Themselves Is Generic
arxiv·5h ago
AX
Omni Interaction Agent Technical Report
arxiv·5h ago
AX
CoGReV: A Confidence-Gated Post-Hoc Non-Monotonic Belief Revision Framework for Phishing Website Classification
arxiv·5h ago
AX
Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability
arxiv·5h ago
AX
Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
arxiv·5h ago
AX
RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
arxiv·5h ago
AX
Tracing Computation Density in LLMs
arxiv·5h ago
AX
Cultural Binding Heads in Language Models
arxiv·5h ago
AX
Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training
arxiv·5h ago
AX
Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models
arxiv·5h ago
AX
Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning
arxiv·5h ago
AX
'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection
arxiv·5h ago
AX
DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation
arxiv·5h ago
AX
Elsewise: Authoring Open-ended Interactive Narrative with Possibility Space Visualization
arxiv·5h ago
AX
"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use
arxiv·5h ago
AX
From Monolithic Blending to Agentic Orchestration: Dynamic Response for Conversational Assistants at Scale
arxiv·5h ago
AX
Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses
arxiv·5h ago
AX
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
arxiv·5h ago
AX
EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering
arxiv·5h ago
AX
Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling
arxiv·5h ago
AX
GANDR: Claim Auditing for Verifiable Legal Answer Generation
arxiv·5h ago
AX
SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities
arxiv·5h ago
AX
When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination
arxiv·5h ago
DB Score30 models