The paper introduces SIEVE, a framework that separates evidence acquisition from veracity verification in multimodal video misinformation detection. An evidence-seeking agent actively explores available video and associated modalities, extracts a small set of decision-relevant clues, and packages them for a verifier. Training combines supervised evidence-seeking trajectories with an evidence-aware reinforcement learning objective that rewards informative acquisition while penalizing unnecessary or invalid interactions. The abstract reports consistent gains over evaluated baselines across multiple video misinformation benchmarks, along with a more inspectable evidence trail.
No heat snapshots are available in the last 24 hours.