OCR 与文档智能研究 Wiki

Tag: layout

4 items with this tag.

  • 2026年7月25日

    dots.ocr: Multilingual Document Layout Parsing (1.2B vision encoder + 1.7B decoder, ~3B)

    • ocr
    • document-parsing
    • unified-vlm
    • layout
    • multilingual
    • end-to-end
    • frontend
    • backend
  • 2026年7月23日

    LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

    • ocr
    • document-understanding
    • layout
    • pretraining
    • milestone
  • 2026年7月23日

    Logics-Parsing: End-to-End LVLM with RL for Layout & Reading Order

    • ocr
    • document-parsing
    • reinforcement-learning
    • reading-order
    • layout
    • html-output
    • end-to-end
  • 2026年7月23日

    PaddleOCR-VL: 0.9B Ultra-Compact VLM for Document Parsing

    • ocr
    • document-parsing
    • vlm
    • small-model
    • layout
    • omnidocbench
    • frontend
    • backend

4 items with this tag.

  • 2026年7月25日

    dots.ocr: Multilingual Document Layout Parsing (1.2B vision encoder + 1.7B decoder, ~3B)

    • ocr
    • document-parsing
    • unified-vlm
    • layout
    • multilingual
    • end-to-end
    • frontend
    • backend
  • 2026年7月23日

    LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

    • ocr
    • document-understanding
    • layout
    • pretraining
    • milestone
  • 2026年7月23日

    Logics-Parsing: End-to-End LVLM with RL for Layout & Reading Order

    • ocr
    • document-parsing
    • reinforcement-learning
    • reading-order
    • layout
    • html-output
    • end-to-end
  • 2026年7月23日

    PaddleOCR-VL: 0.9B Ultra-Compact VLM for Document Parsing

    • ocr
    • document-parsing
    • vlm
    • small-model
    • layout
    • omnidocbench
    • frontend
    • backend

Created with Quartz © 2026

  • GitHub