PAPER·May 21, 2026You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 TrajectoriesHugging Face Papers
PAPER·May 21, 2026OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under Optimal Squared Error QuantizationHugging Face Papers
PAPER·May 21, 2026Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and EfficiencyHugging Face Papers
PAPER·May 21, 2026IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic ToolsHugging Face Papers
PAPER·May 21, 2026Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient ProjectionHugging Face Papers
PAPER·May 21, 2026OcclusionFormer: Arranging Z-Order for Layout-Grounded Image GenerationHugging Face Papers
PAPER·May 21, 2026Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable AlignmentHugging Face Papers
PAPER·May 21, 2026iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic GuidanceHugging Face Papers
PAPER·May 21, 2026It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMsHugging Face Papers