论文针对低资源孟加拉语政治表情包识别,先用视觉语言模型从噪声图像中提取OCR文本,再以跨模态多头注意力将文本语义token与视觉区域对齐,并引入政治词典作为知识先验。在 PoliMemeDecode1 数据集上,方法取得约0.94的 Macro-F1,优于单模态与简单拼接基线,解释性分析显示模型能将语义与视觉证据关联。
最近 24 小时暂无可用热度快照。