OCR 与文档智能研究 Wiki

Tag: pretraining

7 items with this tag.

  • 2026年7月29日

    Masked Image Modeling (MIM) — 掩码图像建模

    • self-supervised
    • mim
    • denoising
    • pretraining
  • 2026年7月29日

    BEiT: BERT Pre-Training of Image Transformers

    • self-supervised
    • mim
    • masked-image-modeling
    • vit
    • pretraining
  • 2026年7月29日

    SimMIM: A Simple Framework for Masked Image Modeling

    • self-supervised
    • mim
    • masked-image-modeling
    • vit
    • pretraining
  • 2026年7月23日

    BERT: Pre-training of Deep Bidirectional Transformers

    • nlp
    • transformer
    • pretraining
    • milestone
  • 2026年7月23日

    DiT: Self-supervised Pre-training for Document Image Transformer

    • ocr
    • document-ai
    • self-supervised
    • pretraining
    • milestone
  • 2026年7月23日

    LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

    • ocr
    • document-understanding
    • layout
    • pretraining
    • milestone
  • 2026年7月23日

    Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding

    • ocr
    • visual-language
    • screenshot
    • pretraining
    • milestone

7 items with this tag.

  • 2026年7月29日

    Masked Image Modeling (MIM) — 掩码图像建模

    • self-supervised
    • mim
    • denoising
    • pretraining
  • 2026年7月29日

    BEiT: BERT Pre-Training of Image Transformers

    • self-supervised
    • mim
    • masked-image-modeling
    • vit
    • pretraining
  • 2026年7月29日

    SimMIM: A Simple Framework for Masked Image Modeling

    • self-supervised
    • mim
    • masked-image-modeling
    • vit
    • pretraining
  • 2026年7月23日

    BERT: Pre-training of Deep Bidirectional Transformers

    • nlp
    • transformer
    • pretraining
    • milestone
  • 2026年7月23日

    DiT: Self-supervised Pre-training for Document Image Transformer

    • ocr
    • document-ai
    • self-supervised
    • pretraining
    • milestone
  • 2026年7月23日

    LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking

    • ocr
    • document-understanding
    • layout
    • pretraining
    • milestone
  • 2026年7月23日

    Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding

    • ocr
    • visual-language
    • screenshot
    • pretraining
    • milestone

Created with Quartz © 2026

  • GitHub