64 items with this tag.2026年9月02日ArmorOCR — 困难视觉文本的定位、识别与 Spotting 联合强化ocrscene-texttext-spottinglocalizationadversarial-ocrself-distillationgrpobenchmarkfront-detr-relevantback-ar-relevant2026年9月02日SCVER — 解码状态条件的高分辨率视觉证据检索ocrdocument-parsingautoregressive-decodingvisual-retrievaldeformable-attentionhigh-resolutionefficiencyfront-detr-relevantback-ar-relevant2026年8月07日Noisy-Label / 伪标签学习(带噪标签、合成数据、突破软标签天花板)noisy-labelpseudo-labeldistillationdataocrtraining2026年8月06日Loss Functions 损失函数专题losstrainingdetectionocrfoundation2026年8月04日CTC(Connectionist Temporal Classification)ocrsequencealignment2026年8月04日OmniDocBench(文档解析基准)benchmarkdocument-aiocr2026年8月01日视觉 Token 压缩(Visual Token Compression)ocrvisual-token-compressionefficiencykv-cachevlmback-ar-relevant2026年8月01日LayoutLite — Token 级隐式版面分析加速文档 OCRocrdocument-parsingvisual-token-compressionlayout-analysisgrporeinforcement-learningvlmkv-cachefront-detr-relevantback-ar-relevantplug-and-play2026年8月01日MORE — 149 语种多语言文档解析基准ocrdocument-parsingbenchmarkmultilingualevaluationtedscdmtencentreading-orderfront-detr-relevant2026年7月29日Instance-Mapping(序列对比的实例映射)ocrcontrastive-learningself-supervisedsequence2026年7月29日DiG: Reading and Writing — Discriminative and Generative Modeling for Self-Supervised Text Recognitionocrtext-recognitionself-supervisedmimcontrastive-learningmilestone2026年7月29日SeqCLR — Sequence-to-Sequence Contrastive Learning for Text Recognitionocrself-supervisedcontrastive-learningrepresentation-learninghtrctcattention2026年7月29日降低标注依赖的几条路径(OCR 识别)ocrself-supervisedlabel-efficiencysynthetic-datacontrastive-learning2026年7月28日FCA — Flexible Character Accuracy(阅读顺序无关的字符精度)ocrmetricevaluationreading-order2026年7月28日OCR 系统 vs 多模态 LLM 的系统性评测(Caravani et al., 2027)ocrbenchmarkmllmevaluationlatencycostfine-tuningfca2026年7月25日百度 Baidu / PaddleOCRorgocrdocument-parsingchina2026年7月25日复旦大学 FVL Lab(视觉与学习)orgocrrecognitionchinaacademia2026年7月25日华中科技大学 HUST(白翔组)orgocrtext-recognitionchinaacademia2026年7月25日金山 Kingsoft(WPS)orgocrdocument-aichinacommercial2026年7月25日上海人工智能实验室 / OpenDataLab(MinerU)orgocrdocument-parsingchina2026年7月25日小红书 Xiaohongshu / RedNote hi-laborgocrdocument-parsingchina2026年7月25日Zhipu AI(智谱)orgocrdocument-parsingchina2026年7月25日DeepSeek-OCR: Contexts Optical Compressionocroptical-compressionvision-tokenmoemilestone2026年7月25日dots.ocr: Multilingual Document Layout Parsing (1.2B vision encoder + 1.7B decoder, ~3B)ocrdocument-parsingunified-vlmlayoutmultilingualend-to-endfrontendbackend2026年7月25日FireRed-OCR: Specializing General VLMs into OCR Modelsocrdocument-parsinggrpostructural-hallucinationdata-factorythree-stage-trainingmarkdown2026年7月25日GLM-OCR Technical Reportocrdocument-parsingcompactmulti-token-predictionmilestone2026年7月25日HPD-Parsing — 层次并行解码文档解析ocrdocument-parsingdecodingparallel-decodingmtpspeculative-decodingkv-cachevlmbaidufront-detr-relevantback-ar-relevant2026年7月25日HSD — 免训练层次投机解码加速文档解析ocrdocument-parsingdecodingspeculative-decodingparallel-decodingtraining-freekv-cacheback-ar-relevant2026年7月25日MonkeyOCRv2: A Visual-Text Foundation Model for Document AIocrdocument-aivisual-encoderfoundation-modelmilestone2026年7月25日Nougat: Neural Optical Understanding for Academic Documentsdocument-aiocrformulamilestone2026年7月25日Ovis-OCR2: 0.8B End-to-End Document Parsing (OmniDocBench SOTA)ocrdocument-parsingend-to-endsmall-modeldata-enginesynthetic-datadistillationmilestone2026年7月25日Parser-Oriented Structural Refinement — 稳定 DETR→解析器 界面ocrdocument-parsingdetrd-finelayout-interfaceretentionreading-ordernms-freefront-detr-relevantback-ar-relevant2026年7月25日RT-DocLayout — 实时端到端文档版面分析(含阅读顺序)ocrdocument-layout-analysisdladetrrt-detrdetectionsegmentationreading-orderbaidufront-detr-relevant2026年7月25日Unlimited OCR — R-SWA 恒定 KV 长文档解析ocrdocument-parsingkv-cachesliding-window-attentionlong-documentdecodingbaiduback-ar-relevant2026年7月23日端到端 OCR / 文档解析模型横评ocrdocument-aicomparisonbenchmark2026年7月23日Character Region Awareness for Text Detection (CRAFT)ocrtext-detectionmilestone2026年7月23日An End-to-End Trainable Neural Network for Image-based Sequence Recognition (CRNN)ocrtext-recognitionmilestone2026年7月23日DiffBrush: Diffusion Brush for Handwritten Text-Line Generationhtghandwritingdiffusiontext-linestyle-disentanglesynthetic-dataocr2026年7月23日DiT: Self-supervised Pre-training for Document Image Transformerocrdocument-aiself-supervisedpretrainingmilestone2026年7月23日Dolphin-v2: Scalable Anchor Prompting for Document Parsingocrdocument-parsinganchor-promptingphotographed-docsfine-grained-detectionhybrid-parsingfrontend2026年7月23日Dolphin: Document Image Parsing via Heterogeneous Anchor Promptingocrdocument-parsinganchor-promptingparallel-decodingtwo-stageanalyze-then-parsefrontendbackend2026年7月23日OCR-free Document Understanding Transformer (Donut)ocrdocument-understandingocr-freemilestone2026年7月23日GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documentsocrbenchmarkdocument-reasoningmultimodalmilestone2026年7月23日General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model (GOT)ocrocr-20unifiedend-to-endmilestone2026年7月23日HunyuanOCR: Commercial-grade Lightweight 1B OCR VLMocrvlmsmall-modelunifiedspottingtranslationend-to-end2026年7月23日Agentic Document Extraction Gen2 (DPT-3 family)document-aicommerciallandingaidpt3ocr2026年7月23日Detecting Signatures, Stamps and Seals (ADE Attestation Detection)document-ailandingaiattestationocr2026年7月23日LayoutLMv3: Pre-training for Document AI with Unified Text and Image Maskingocrdocument-understandinglayoutpretrainingmilestone2026年7月23日Logics-Parsing-Omni: Unified Omni Parsing (documents/images/AV)ocrdocument-parsingomnievidence-anchoringprogressive-parsingreading-order2026年7月23日Logics-Parsing: End-to-End LVLM with RL for Layout & Reading Orderocrdocument-parsingreinforcement-learningreading-orderlayouthtml-outputend-to-end2026年7月23日MinerU2.5-Pro: Data-Driven Document Parsing (same 1.2B architecture)ocrdocument-parsingdata-enginetraining-strategygrpoomnidocbenchmilestone2026年7月23日MinerU2.5: A Decoupled VLM for Efficient High-Resolution Document Parsingocrdocument-parsingvlmdecoupledhigh-resolutioncoarse-to-finefrontendbackend2026年7月23日OCRVerse: Towards Holistic OCR in End-to-Endocrholistic-ocrend-to-enddata-engineeringsft-rltext-centricvision-centric2026年7月23日PaddleOCR-VL: 0.9B Ultra-Compact VLM for Document Parsingocrdocument-parsingvlmsmall-modellayoutomnidocbenchfrontendbackend2026年7月23日Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understandingocrvisual-languagescreenshotpretrainingmilestone2026年7月23日POINTS-Reader: Distillation-Free Adaptation of VLMs for Document Conversionocrdocument-parsingdistillation-freesynthetic-dataself-improvementend-to-end2026年7月23日Qianfan-OCR: Unified End-to-End Document Intelligence (Layout-as-Thought)ocrdocument-intelligenceend-to-endlayout-as-thoughtthinkingreading-orderomnidocbench2026年7月23日TrOCR: Transformer-based Optical Character Recognition with Pre-trained Modelsocrtext-recognitiontransformermilestone2026年7月23日UniRec-0.1B: Unified Text and Formula Recognition (0.1B)ocrrecognitiontiny-modelhierarchical-supervisionsemantic-decoupled-tokenizerformulatablebackend2026年7月23日Youtu-Parsing: High-Parallelism Decoding for Document Parsingocrdocument-parsingparallel-decodingtoken-parallelismquery-parallelismregion-promptbackendfrontend2026年7月23日手写文本合成 (HTG) — 为 OCR 造手写训练数据的方法专题synthesissynthetic-datahandwritinghtgdiffusionocrtraining-data2026年7月23日端到端 OCR / 文档解析的演进史ocrdocument-aisynthesisroadmap2026年7月23日OCR/文档解析的合成数据 — 方法专题synthesissynthetic-datadata-engineocrdocument-parsingtraining-data2026年7月23日视觉压缩 vs 视觉重建:文档视觉表示的路线之争ocrdocument-aisynthesisdebate