PAPER·May 20, 2026OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone EnvironmentsHugging Face Papers
PAPER·May 20, 2026Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated VideosHugging Face Papers
PAPER·May 20, 2026PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language ModelsHugging Face Papers
PAPER·May 20, 2026OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache QuantizationHugging Face Papers
PAPER·May 20, 2026SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational ScienceHugging Face Papers
PAPER·May 20, 2026Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE RoutersHugging Face Papers
PAPER·May 20, 2026Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal ScoringHugging Face Papers
PAPER·May 20, 2026TopoPrimer: The Missing Topological Context in Forecasting ModelsHugging Face Papers
PAPER·May 20, 2026AR-VLA: True Autoregressive Action Expert for Vision-Language-Action ModelsHugging Face Papers
PAPER·May 20, 2026AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMsHugging Face Papers