OCR 与文档智能研究 Wiki

Tag: backend

6 items with this tag.

  • 2026年7月25日

    dots.ocr: Multilingual Document Layout Parsing (1.2B vision encoder + 1.7B decoder, ~3B)

    • ocr
    • document-parsing
    • unified-vlm
    • layout
    • multilingual
    • end-to-end
    • frontend
    • backend
  • 2026年7月23日

    Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting

    • ocr
    • document-parsing
    • anchor-prompting
    • parallel-decoding
    • two-stage
    • analyze-then-parse
    • frontend
    • backend
  • 2026年7月23日

    MinerU2.5: A Decoupled VLM for Efficient High-Resolution Document Parsing

    • ocr
    • document-parsing
    • vlm
    • decoupled
    • high-resolution
    • coarse-to-fine
    • frontend
    • backend
  • 2026年7月23日

    PaddleOCR-VL: 0.9B Ultra-Compact VLM for Document Parsing

    • ocr
    • document-parsing
    • vlm
    • small-model
    • layout
    • omnidocbench
    • frontend
    • backend
  • 2026年7月23日

    UniRec-0.1B: Unified Text and Formula Recognition (0.1B)

    • ocr
    • recognition
    • tiny-model
    • hierarchical-supervision
    • semantic-decoupled-tokenizer
    • formula
    • table
    • backend
  • 2026年7月23日

    Youtu-Parsing: High-Parallelism Decoding for Document Parsing

    • ocr
    • document-parsing
    • parallel-decoding
    • token-parallelism
    • query-parallelism
    • region-prompt
    • backend
    • frontend

6 items with this tag.

  • 2026年7月25日

    dots.ocr: Multilingual Document Layout Parsing (1.2B vision encoder + 1.7B decoder, ~3B)

    • ocr
    • document-parsing
    • unified-vlm
    • layout
    • multilingual
    • end-to-end
    • frontend
    • backend
  • 2026年7月23日

    Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting

    • ocr
    • document-parsing
    • anchor-prompting
    • parallel-decoding
    • two-stage
    • analyze-then-parse
    • frontend
    • backend
  • 2026年7月23日

    MinerU2.5: A Decoupled VLM for Efficient High-Resolution Document Parsing

    • ocr
    • document-parsing
    • vlm
    • decoupled
    • high-resolution
    • coarse-to-fine
    • frontend
    • backend
  • 2026年7月23日

    PaddleOCR-VL: 0.9B Ultra-Compact VLM for Document Parsing

    • ocr
    • document-parsing
    • vlm
    • small-model
    • layout
    • omnidocbench
    • frontend
    • backend
  • 2026年7月23日

    UniRec-0.1B: Unified Text and Formula Recognition (0.1B)

    • ocr
    • recognition
    • tiny-model
    • hierarchical-supervision
    • semantic-decoupled-tokenizer
    • formula
    • table
    • backend
  • 2026年7月23日

    Youtu-Parsing: High-Parallelism Decoding for Document Parsing

    • ocr
    • document-parsing
    • parallel-decoding
    • token-parallelism
    • query-parallelism
    • region-prompt
    • backend
    • frontend

Created with Quartz © 2026

  • GitHub