DiscoBench evaluates whether deep-search agents can recognize underspecified, vague, or factually incorrect requests, ask useful clarification questions, and recover the correct reasoning path through interaction. The benchmark contains 211 samples and 463 ambiguity instances across 11 real-world domains and four ambiguity types. It also introduces a user simulator for multi-turn evaluation across task utility, ambiguity detection, interaction strategy, and cost efficiency. Reported experiments suggest that detecting ambiguity and clarifying it effectively are separate capabilities, while repeatedly searching instead of asking can perform worse than directly guessing.
No heat snapshots are available in the last 24 hours.