PAPER·May 19, 2026MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI AgentsHugging Face Papers
PAPER·May 19, 2026CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?Hugging Face Papers
PAPER·May 19, 2026VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool InvocationHugging Face Papers
PAPER·May 19, 2026E-PMQ: Expert-Guided Post-Merge Quantization with Merged-Weight AnchoringHugging Face Papers
PAPER·May 19, 2026TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using AgentsHugging Face Papers
PAPER·May 19, 2026FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language ModelsHugging Face Papers
PAPER·May 19, 2026SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-TrainingHugging Face Papers
PAPER·May 19, 2026A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark GenerationHugging Face Papers
PAPER·May 19, 2026GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal InteractionsHugging Face Papers
PAPER·May 19, 2026Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning DynamicsHugging Face Papers
PAPER·May 19, 2026SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to EvolutionHugging Face Papers