Audio-Visual Flamingo (AV-Flamingo) is an open audio-visual large language model for joint reasoning over audio, images, and long-form videos. The work introduces Audio-Visual-Skills, a dataset containing approximately 7 million captioning and question-answer instances; a three-stage curriculum that progresses from short-range perception to long-horizon multi-event reasoning; and Temporal Audio-Visual Interleaved Chain-of-Thought, which grounds intermediate reasoning steps to timestamps. The authors report evaluations across more than 15 audio-visual, omni-modal, audio, and vision benchmarks, with strong results against similarly sized open models and competitive performance relative to larger models.
No heat snapshots are available in the last 24 hours.