PAPER·May 22, 2026Learning from Language Feedback via Variational Policy DistillationHugging Face Papers
PAPER·May 22, 2026SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS EngineeringHugging Face Papers
PAPER·May 22, 2026Lost in the Folds: When Cross-Validation Is Not a Deep Ensemble for Uncertainty EstimationHugging Face Papers
PAPER·May 21, 2026LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial HardeningHugging Face Papers
PAPER·May 21, 2026A Survey of Large Audio Language Models: Generalization, Trustworthiness, and OutlookHugging Face Papers
PAPER·May 21, 2026Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic SimulationHugging Face Papers
PAPER·May 21, 2026Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent PretrainingHugging Face Papers
PAPER·May 21, 2026MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill OptimizationHugging Face Papers
PAPER·May 21, 2026CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production EditingHugging Face Papers
PAPER·May 21, 2026Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMsHugging Face Papers