Command Palette
Search for a command to run...
Papers
Daily updated cutting-edge AI research papers to help you keep up with the latest AI trends
2,830 papers

CAST: GAME SOLVERS AS TURN-LEVEL TEACHERS FOR LLM AGENTS

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

HumanCLAW: Can Vision-Language Models Act Through a Body?

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM

Parallel Decoding Distillation for Fast Image and Video Generation

SETTLING THE OPTIMAL EXPONENT RELATING SUMSETS AND DIFFERENCE SETS

Test-Time Scaling via Error Localization

NVIDIA-labs OO Agents Native Python Object-Oriented Agents

PERCEPTIONBENCH: EVALUATING ATOMIC VISUAL PERCEPTION IN MULTIMODAL LARGE LANGUAGE MODELS

Horizon Selection in Physics-Enhanced Neural ODEs: Theoretical Insights and Flux Linkage Application

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

Verification of Provers and Solvers

The Model in the Middle: Toward AI-Native Real-Time Communication

DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors

MemoHarness: Agent Harnesses That Learn from Experience

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

RETHINKING CLASSIFIER-FREE GUIDANCE IN ON-POLICY DIFFUSION DISTILLATION

STATEACT: PROGRAM STATE, BEFORE PIXELS, FOR LONG-HORIZON COMPUTER-USE AGENTS

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

KIMI K3: OPEN FRONTIER INTELLIGENCE

MUSIC-JEPA: LEARNING A WORLD MODEL OF SOUND FROM ACTION

LLMs can’t jump

LLMs Get Lost in Evolving User Intent

SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales

Improved Distribution Matching Distillation for Fast Image Synthesis

THREE-BODY SCATTERING FOR GENERATIVE MODELING
2,830 papers

CAST: GAME SOLVERS AS TURN-LEVEL TEACHERS FOR LLM AGENTS

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

HumanCLAW: Can Vision-Language Models Act Through a Body?

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

TURBOVLA: REAL-TIME VISION-LANGUAGE-ACTION MODEL AT 32 HZ ON AN RTX 4090 WITH <1 GB VRAM

Parallel Decoding Distillation for Fast Image and Video Generation

SETTLING THE OPTIMAL EXPONENT RELATING SUMSETS AND DIFFERENCE SETS

Test-Time Scaling via Error Localization

NVIDIA-labs OO Agents Native Python Object-Oriented Agents

PERCEPTIONBENCH: EVALUATING ATOMIC VISUAL PERCEPTION IN MULTIMODAL LARGE LANGUAGE MODELS

Horizon Selection in Physics-Enhanced Neural ODEs: Theoretical Insights and Flux Linkage Application

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

Verification of Provers and Solvers

The Model in the Middle: Toward AI-Native Real-Time Communication

DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors

MemoHarness: Agent Harnesses That Learn from Experience

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

RETHINKING CLASSIFIER-FREE GUIDANCE IN ON-POLICY DIFFUSION DISTILLATION

STATEACT: PROGRAM STATE, BEFORE PIXELS, FOR LONG-HORIZON COMPUTER-USE AGENTS

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

KIMI K3: OPEN FRONTIER INTELLIGENCE

MUSIC-JEPA: LEARNING A WORLD MODEL OF SOUND FROM ACTION

LLMs can’t jump

LLMs Get Lost in Evolving User Intent

SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales

Improved Distribution Matching Distillation for Fast Image Synthesis

THREE-BODY SCATTERING FOR GENERATIVE MODELING