arXiv 预印本Homayoun Afshari
动态逻辑张量网络与VLM协同:神经符号视觉推理的新闭环
原标题:Think-Verify-Revise: Neuro-Symbolic Visual Reasoning with Vision-Language Models and Dynamic Logic Tensor Networks
论文76
视觉推理任务要求系统能够协同感知视觉内容并应用形式化关系约束——单纯的神经方法或纯符号方法在孤立状态下均难以妥善处理这一结合。本文提出了一种神经符号(NeSy)框架以弥合这一差距,该框架在一个闭环迭代反馈回路中,紧密耦合了用于自动一阶逻辑(FOL)规则归纳的视觉语言模型(VLM)与用于可微规则验证的动态逻辑张量网络(D-LTN)。VLM 接收少量的标注视觉示例,并提出符合严格语法的候选 FOL 规则(Think);D-LTN 在运行时根据这些规则自动组装,并基于 CNN 生成的视觉嵌入对规则进行评估(Verify);验证失败的信息则会被反馈用于指导 VLM 的下一次假设生成(Revise)。在涵盖四个视觉领域(MNIST、EMNIST、KMNIST、FMNIST)的 ViSudo-PC 基准测试评估中,该系统仅使用三个训练示例作为视觉上下文,即可归纳出有效的数独约束规则。所提出的方法取得了与以往方法(NeuPSL、LTN)相当或更优的 AUC 分数,展现了借助 VLM 进行自动规则发现的潜力。代码可在 https://github.com/homayoun-afshari/nesy 获取。
为什么值得读
展示了将大模型作为规则假设器、结合可微逻辑求解器实现闭环自纠偏的可行路径,为少样本符号归纳提供了清晰的工程原型。
标签
Neuro-SymbolicVisual ReasoningVLMFirst-Order LogicLogic Tensor NetworksRule InductionarXiv