MonkeyOCRv2针对自然图像视觉编码器难以处理密集文字、细笔画与复杂版式的问题,构建包含1.13亿张图像、覆盖17种语言的MonkeyDoc v2数据集,并联合图像到文本生成与像素级文档重建进行预训练。在五类文档任务及多模态文档解析、理解评测中取得稳定提升;冻结视觉编码器配合轻量语言模型,可构成0.7B文档解析模型,在MDPBench上较3B dots.mocr提升2.8个百分点。
最近 24 小时暂无可用热度快照。