Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

观察中研究观察中0 家独立报道0

ViPo-MLLM:面向无Gloss手语翻译的视觉姿态多模态大模型

首次出现 · 2026/7/4 09:17最近活动 · 2026/7/4 09:17

ViPo-MLLM面向无需Gloss标注的手语翻译,将RGB视频与人体姿态特征结合,通过专用编码器、跨模态注意力和结构化提示建模手部、身体及面部线索,并以对比学习和语言建模目标训练LLM。在PHOENIX14T与CSL-Daily上取得论文所称的新SOTA,且接近部分基于Gloss的方法。

最近 24 小时事件热度

最近 24 小时暂无可用热度快照。

最近 24 小时暂无可用热度快照。

报道时间线

  1. 聚合入口arXiv 预印本7/4 09:17非独立信源代表报道
    ViPo-MLLM:面向无Gloss手语翻译的视觉姿态多模态大模型