该论文提出面向音视频抑郁检测的细粒度多模态框架,结合时间编码器与互注意力Transformer进行跨模态融合。核心是二元优势加权排序损失,通过难样本分离和类内紧致性优化潜在空间,据称在D-vlog和LMVD数据集上取得当前最佳性能。
最近 24 小时暂无可用热度快照。