关于本 Wiki
这是一个公开的中文 OCR 与文档智能研究知识库,持续整理深度学习、计算机视觉、自然语言处理、OCR 与文档解析领域的重要论文和方法。
目标
- 提炼论文中的核心 idea、方法、架构选择、实验结论与工程经验。
- 建立论文、研究者、机构与技术概念之间的双向链接。
- 逐步形成一套面向 OCR 与文档智能研究者的系统化中文参考资料。
内容标准
- 准确:关键结论尽量回到论文原文核对,并提供 arXiv、DOI 或官方页面。
- 系统:从基础概念、核心架构到前沿论文,按知识关系组织,而非简单堆放摘要。
- 可复用:关注方法为什么有效、适用边界、代价和可迁移的设计经验。
- 中文书写:专有名词、模型名和必要术语保留英文。
内容范围
- 深度学习与 Transformer 基础
- 目标检测、视觉编码器与自监督学习
- OCR、文档版面分析与结构化解析
- 自回归生成、解码加速与视觉 token 压缩
- 训练策略、数据构造、评测方法与系统比较
页面类型
sources/:论文与资料精读concepts/:理论、方法和技术概念entities/:研究者、机构、产品与模型comparisons/:并列比较synthesis/:跨论文专题综述
从 内容目录 开始浏览。