这篇综述系统梳理多模态大模型理解视觉幽默的研究,覆盖表情包、漫画和多格漫画中的识别、解释推理与生成。文章总结从任务专用融合模型到多模态对齐、证据支撑推理和可控生成的演进,并指出评测捷径、文化覆盖不足、证据 grounding 薄弱,以及安全与版权问题仍是主要瓶颈。
最近 24 小时暂无可用热度快照。