视觉压缩 vs 视觉重建:文档视觉表示的路线之争
2024–2026 文档智能领域最有意思的一个技术对立。核心分歧: “用尽量少的 vision token 装下页面” 还是 “确保 vision token 真的保住了页面证据”。
一、视觉压缩派 —— deepseek-ocr
主张:把文本渲染成图像,用远少于文本 token 数的 vision token 承载,再高精度还原。
- Contexts Optical Compression:文本 token ≤ vision token 数 10 倍(压缩比 <10×)时 OCR 精度 97%; 20× 压缩仍 ~60%
- 意义超出 OCR:把文档当作 LLM 长上下文的压缩介质,牵连”记忆/遗忘/长上下文成本”
- GOT-OCR2.0 的 80M 高压缩 encoder 也属这一路(A4 页只需少量 token)
赌注:视觉是比文本 token 更省的信息载体。
二、视觉重建派 —— monkeyocr-v2
质疑:高压缩下的高准确率,可能是”视觉识别 + 语言补全”的混合产物。
- 当视觉信号不完整,强语言模型能靠常识/句法把缺失内容猜成一个流畅甚至看似正确的答案
- 独立研究用语义扰动证明:破坏正常语言上下文后,deepseek-ocr 表现显著下降
- → “只看最终答案像不像真的,分不清模型看到了多少 vs 猜回来了多少”
主张:给视觉编码器加像素级重建目标(“画回来”),逼它保留字符笔画/小数点/版面。
- 一场闭卷考试:编码器若忘了细节,decoder 不可能把原页重建出来
- 强调把 压缩效率 与 视觉保真 分开测量
赌注:对文档而言,忽略细节 = 错误本身(“1和7、小数点、上下标位置”都改变答案)。
三、这不是零和
- 两派回答的是互补问题:压缩问”能装多少”,重建问”留下了什么”
- 与 mae 的关系有趣:MAE 也用重建做自监督,但目标是学语义(可忽略细节); 文档重建恰恰要保细节 —— 同一技术(重建),文档域诉求相反
- 可靠的文档智能可能需要兼顾容量与证据:既压得动,又证明压缩后信息没丢
四、对下游的启示
- 长文档/多页解析:压缩派更省成本,重建派更保精度 → 场景决定取舍
- 评测要跟上:GDP.pdf 强调 grounding + 拒答,正是在逼模型”别猜”
- 底座之争延伸:monkeyocr-v2 造可替换视觉底座 vs 端到端大一统(见 OCR 演进史)