PAPER·May 25, 2026AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language ModelsarXiv
PAPER·May 25, 2026WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model EvaluationarXiv
PAPER·May 25, 2026When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable RewardsarXiv
PAPER·May 25, 2026MuNet: A Mutualistic Network for Joint 3D Human Mesh Recovery and 3D Clothed Human Reconstruction from Single ImagesarXiv
PAPER·May 25, 2026OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic ManipulationarXiv
PAPER·May 25, 2026[CLS] Is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive AggregationarXiv
PAPER·May 25, 2026Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language ModelsarXiv
PAPER·May 23, 2026Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry TransformersarXiv