Frontier AI models corrupt 25% of document content

TL;DR AI
2 min readKey summary
Microsoft researchers introduced DELEGATE-52, a benchmark for reversible multi-step document tasks across 52 professional domains.
Top frontier AI models silently introduced errors that accumulated over repeated edits, degrading documents by about 25% on average.
Adding tools or distractor documents made performance worse, exposing weak reliability in delegated document workflows.
The findings raise concerns about using current models for high-stakes knowledge work that requires autonomy, repeated revisions, or long task chains.
