PAPER·May 20, 2026Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention DiscrepancyarXiv
PAPER·May 20, 2026Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware ConditioningarXiv
PAPER·May 20, 2026CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language ModelsarXiv
PAPER·May 20, 2026Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language ModelsarXiv
PAPER·May 20, 2026MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint ModelingarXiv
PAPER·May 20, 2026CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic ReasoningarXiv
PAPER·May 20, 2026Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon AgentsarXiv
PAPER·May 20, 2026PromptRad: Knowledge-Enhanced Multi-Label Prompt-Tuning for Low-Resource Radiology Report LabelingarXiv
PAPER·May 20, 2026CAMERA: Adapting to Semantic Camouflage in Unsupervised Text-Attributed Graph Fraud DetectionarXiv
PAPER·May 20, 2026AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI CollaborationarXiv
PAPER·May 20, 2026CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent CognitionarXiv