端到端 OCR / 文档解析模型横评

聚焦 2021–2026 的端到端 / OCR-free 路线,对比参数、核心创新、评测。

主力对比(新一代端到端小模型)

模型年份机构参数核心创新关键评测
GOT-OCR2.02024学界580M(80M enc + 0.5B dec)统一端到端 OCR-2.0,高压缩 encoder,可交互 region OCR密集 OCR 强,通吃公式/表格/乐谱
deepseek-ocr2024DeepSeek—Contexts Optical Compression(文本→vision token)10× 压缩 97% 精度,20× ~60%
ovis-ocr22026阿里0.8B端到端 + RL + on-policy 蒸馏 + 模型融合OmniDocBench v1.6 96.58 SOTA
glm-ocr2026智谱0.9B(CogViT 0.4B + GLM 0.5B)Multi-Token Prediction 加速确定性解码OmniDocBench v1.5 94.6 第一
monkeyocr-v22026—(视觉底座)图→文生成 + 像素级重建,文档原生 encoder;开源 MonkeyDoc v2(1.13亿图/17语言)即插即用提升下游(CRNN 58.7%→67.3%)

前代 / 铺路模型

模型年份路线特点
trocr2021端到端识别ViT 编码 + 文本解码,抛弃 CNN+RNN+CTC
donut2021OCR-free图像 → 结构化 JSON,OCR-free 先驱
nougat2023OCR-free学术 PDF → LaTeX Markdown,Swin + mBART

关键观察

  1. 参数越做越小:从数十亿 LVLM → 0.5–0.9B 专用模型登顶主流榜
  2. 两种”小而强”路径:
  3. 效率创新分化:光学压缩(deepseek-ocr)/ MTP 解码(glm-ocr)/ RL+蒸馏(ovis-ocr2)
  4. 评测榜:OmniDocBench 已到 94–96 高位 → 榜单趋于饱和, GDP.pdf 这类 grounded 推理榜(最好仅 30.7%)暴露真正差距

选型建议(粗略)

关联