论文提出SVF-CR框架,以相同时间分段提取整段视频与人脸裁剪令牌,通过模态内自注意力及双向视觉-面部交叉注意力进行同步细化,再结合一致性与差异性构造证据,并与文本、声学特征进行成对证据融合。在BAH公开评测划分上,public macro-F1达到0.7156。
最近 24 小时暂无可用热度快照。