Command Palette
Search for a command to run...
Papers
Daily updated cutting-edge AI research papers to help you keep up with the latest AI trends
papers

Cambrian-S: Towards Spatial Supersensing in Video

Scaling Agent Learning via Experience Synthesis






























papers

Cambrian-S: Towards Spatial Supersensing in Video

Scaling Agent Learning via Experience Synthesis






























V-Thinker: Interactive Thinking with Images
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
Recent Developments in Amber Biomolecular Simulations
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers
Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video
DR. WELL: Dynamic Reasoning and Learning with Symbolic World Model for Embodied LLM-Based Multi-Agent Collaboration
Orion-MSP: Multi-Scale Sparse Attention for Tabular In-Context Learning
TabTune: A Unified Library for Inference and Fine-Tuning Tabular Foundation Models
Step-Audio-EditX Technical Report
LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
Diffusion Language Models are Super Data Learners
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
Dynamic Population Distribution Aware Human Trajectory Generation with Diffusion Model
Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models
Kosmos: An AI Scientist for Autonomous Discovery
Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR
Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
The AI Productivity Index (APEX)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
Towards Robust Mathematical Reasoning
Towards a future space-based, highly scalable AI infrastructure system design
PHUMA: Physically-Grounded Humanoid Locomotion Dataset
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
V-Thinker: Interactive Thinking with Images
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
Recent Developments in Amber Biomolecular Simulations
UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers
Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video
DR. WELL: Dynamic Reasoning and Learning with Symbolic World Model for Embodied LLM-Based Multi-Agent Collaboration
Orion-MSP: Multi-Scale Sparse Attention for Tabular In-Context Learning
TabTune: A Unified Library for Inference and Fine-Tuning Tabular Foundation Models
Step-Audio-EditX Technical Report
LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
Diffusion Language Models are Super Data Learners
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
Dynamic Population Distribution Aware Human Trajectory Generation with Diffusion Model
Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models
Kosmos: An AI Scientist for Autonomous Discovery
Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR
Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
The AI Productivity Index (APEX)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
Towards Robust Mathematical Reasoning
Towards a future space-based, highly scalable AI infrastructure system design
PHUMA: Physically-Grounded Humanoid Locomotion Dataset
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph