论文在多语言视觉选择题基准 EXAMS-V 上评估测试时扩展,比较 Qwen2.5-VL-7B-Instruct 与 Qwen3.5-4B 的多种搜索和验证方法。结果显示,答案可解析性与单链 token 上限比增加采样链数更关键:token 上限从 1k 提至 2k 可提升 3.7 个百分点,而链数从 8 增至 16 仅提升 0.15 个百分点。最佳配置在 ImageCLEF 2026 测试集达到 84.1%。
最近 24 小时暂无可用热度快照。