SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science
TL;DR AI
2 min readKey summary
Researchers introduced SCICONVBENCH, a benchmark for testing how LLMs clarify vague or contradictory scientific requests through dialogue.
The benchmark spans four computational science domains, including fluid mechanics, solid mechanics, materials science, and partial differential equations.
It evaluates whether models can disambiguate missing details and resolve inconsistencies before carrying out scientific tasks.
Results show current LLMs still struggle with grounding, complete clarification, and reliable task formulation in multi-turn settings.
