BEiT (2021) — 图像版 BERT,MIM 的开山之一
📄 arXiv:2106.08254 · MSRA + HIT(furu-wei/Li Dong)
一句话
把 BERT 的 masked language modeling 搬到视觉:masked image modeling (MIM)。随机遮住部分 image patch,让 ViT 编码器恢复被遮 patch 的”visual token”(不是原始像素)。
核心设计
- 两种视图:image patch(16×16)+ visual token(离散 token)。先用一个 dVAE tokenizer 把图 tokenize 成离散视觉 token 作为预测目标。
- 预训练目标:遮住部分 patch → ViT 编码 corrupted 图 → 预测被遮位置的 visual token(分类任务,非像素回归)。
- 为什么不直接回归像素:作者认为 pixel-level 恢复会把建模力浪费在短程依赖和高频细节上 → 用离散 token 逼模型学语义。(mae/simmim 后来证明直接回归像素也行,见下)
- 预训练后丢弃 MIM head,编码器接下游任务微调。