Command Palette
Search for a command to run...
Papers
Daily updated cutting-edge AI research papers to help you keep up with the latest AI trends
papers

CAST: GAME SOLVERS AS TURN-LEVEL TEACHERS FOR LLM AGENTS

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition






























papers

CAST: GAME SOLVERS AS TURN-LEVEL TEACHERS FOR LLM AGENTS

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition






























DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
HumanCLAW: Can Vision-Language Models Act Through a Body?
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM
Parallel Decoding Distillation for Fast Image and Video Generation
SETTLING THE OPTIMAL EXPONENT RELATING SUMSETS AND DIFFERENCE SETS
Test-Time Scaling via Error Localization
NVIDIA-labs OO Agents Native Python Object-Oriented Agents
PERCEPTIONBENCH: EVALUATING ATOMIC VISUAL PERCEPTION IN MULTIMODAL LARGE LANGUAGE MODELS
Horizon Selection in Physics-Enhanced Neural ODEs: Theoretical Insights and Flux Linkage Application
Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design
Fine-Grained Food Image Understanding via Target-Aware Data Alignment
Verification of Provers and Solvers
The Model in the Middle: Toward AI-Native Real-Time Communication
DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors
MemoHarness: Agent Harnesses That Learn from Experience
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model
RETHINKING CLASSIFIER-FREE GUIDANCE IN ON-POLICY DIFFUSION DISTILLATION
STATEACT: PROGRAM STATE, BEFORE PIXELS, FOR LONG-HORIZON COMPUTER-USE AGENTS
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
KIMI K3: OPEN FRONTIER INTELLIGENCE
MUSIC-JEPA: LEARNING A WORLD MODEL OF SOUND FROM ACTION
LLMs can’t jump
LLMs Get Lost in Evolving User Intent
SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales
Improved Distribution Matching Distillation for Fast Image Synthesis
THREE-BODY SCATTERING FOR GENERATIVE MODELING
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
HumanCLAW: Can Vision-Language Models Act Through a Body?
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM
Parallel Decoding Distillation for Fast Image and Video Generation
SETTLING THE OPTIMAL EXPONENT RELATING SUMSETS AND DIFFERENCE SETS
Test-Time Scaling via Error Localization
NVIDIA-labs OO Agents Native Python Object-Oriented Agents
PERCEPTIONBENCH: EVALUATING ATOMIC VISUAL PERCEPTION IN MULTIMODAL LARGE LANGUAGE MODELS
Horizon Selection in Physics-Enhanced Neural ODEs: Theoretical Insights and Flux Linkage Application
Explicit Layer Modeling for Video Object Insertion and Layer Decomposition
Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design
Fine-Grained Food Image Understanding via Target-Aware Data Alignment
Verification of Provers and Solvers
The Model in the Middle: Toward AI-Native Real-Time Communication
DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors
MemoHarness: Agent Harnesses That Learn from Experience
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model
RETHINKING CLASSIFIER-FREE GUIDANCE IN ON-POLICY DIFFUSION DISTILLATION
STATEACT: PROGRAM STATE, BEFORE PIXELS, FOR LONG-HORIZON COMPUTER-USE AGENTS
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
KIMI K3: OPEN FRONTIER INTELLIGENCE
MUSIC-JEPA: LEARNING A WORLD MODEL OF SOUND FROM ACTION
LLMs can’t jump
LLMs Get Lost in Evolving User Intent
SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales
Improved Distribution Matching Distillation for Fast Image Synthesis
THREE-BODY SCATTERING FOR GENERATIVE MODELING