MultiRef-Compass introduces a benchmark for multi-reference-to-audio-video generation, a setting that requires models to preserve and compose multiple references while producing synchronized visual and audio content. It contains 350 curated samples spanning multi-view subject preservation, multi-entity binding, and human-object-scene composition. The protocol evaluates four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, across 14 sub-metrics. It combines automatic evaluation with a rejudging-enhanced MLLM-as-a-Judge framework. Experiments on eight representative MR2AV systems show substantial weaknesses across several dimensions.
No heat snapshots are available in the last 24 hours.