ViPo-MLLM面向无需Gloss标注的手语翻译,将RGB视频与人体姿态特征结合,通过专用编码器、跨模态注意力和结构化提示建模手部、身体及面部线索,并以对比学习和语言建模目标训练LLM。在PHOENIX14T与CSL-Daily上取得论文所称的新SOTA,且接近部分基于Gloss的方法。
最近 24 小时暂无可用热度快照。