腾讯混元团队发布HunyuanOCR-1.5,一款统一处理文档解析、文字检测、信息抽取、图文翻译和多图理解的端到端OCR视觉语言模型。在不重做骨干网络的前提下,模型引入面向OCR解码的DFlash,并通过Agentic Data Flow补强古文字、图表表格、多图问答、低资源多语种和幻觉评测等长尾能力。摘要称其在Transformer推理下加速6.37倍、vLLM下加速2.14倍,并计划开源权重与训练代码。
最近 24 小时暂无可用热度快照。