SimMIM (2021) — 最简 MIM:直接回归像素就够
📄 arXiv:2111.09886 · MSRA(Han Hu 等)
一句话
把 MIM 剥到最简:不要 block-wise 掩码、不要 dVAE/聚类 tokenizer,就随机遮 patch + 直接 ℓ1 回归被遮位置的 RGB 原始像素 + 一层线性 head,照样学到强表示。
三个关键发现(消融得出)
- 随机掩码 + 适中偏大的 patch size(如 32) 就是强 pretext;掩码块要够大,逼模型做语义推理而非复制邻近像素。
- 直接回归原始 RGB 像素(ℓ1)不比 beit 那种复杂的 patch-classification 差。
- prediction head 可轻到一层线性层,不比重的差。
结果
- ViT-B 在 ImageNet-1K 上自预训练 → 微调 83.8% top-1(超前最好 +0.6%)。
- SwinV2-H(650M)仅用 IN-1K 达 87.1%;帮 3B 的 SwinV2-G 用 40× 更少标注 达 SOTA。