Masked Image Modeling (MIM)

视觉自监督主流范式:遮住部分 image patch,让编码器重建被遮内容,从而学到语义表示。本质是 masking 式的 denoising(源头 dae),视觉版的 BERT MLM。

三种代表做法

方法预测目标掩码编码器特点
beit离散 visual token(dVAE)block-wise全图需 tokenizer
simmim原始 RGB 像素(ℓ1)随机、大 patch(32)全图极简、一层 head
mae原始像素随机 75% 高掩码仅可见 patch(非对称)省算力

结论趋同:直接回归像素 + 随机掩码 + 轻 head 就够(SimMIM/MAE),不必 tokenizer。

与 denoising / contrastive 的关系

  • MIM ⊂ denoising:masking 是一种结构化 corruption(dae)。denoising 更一般(噪声/模糊等)。
  • MIM 学生成/上下文,contrastive(seqclr/contrastive-learning)学判别,互补 → dig 在文本识别里把两者合流。

用于文本识别 encoder

dig 首次把 MIM 用于文本识别(patch 4×4、掩码率 0.6、像素重建),与对比分支共享 ViG encoder。见 label-efficient-ocr。