LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues
TL;DR AI
2 min readKey summary
Researchers released LongMemEval-V2, a benchmark for long-term agent memory in web environments.
It includes 451 curated questions spanning five memory abilities and long trajectory histories.
In experiments, AgentRunbook-C performed best overall, while coding-agent methods improved accuracy but increased latency.
The benchmark is meant to better test whether memory systems help agents learn recurring workflows and pitfalls.
