MAE (2021) — 深度精读
📄 原文:arXiv:2111.06377 · PDF
一句话定位
MAE(Masked Autoencoders)把 bert 的”掩码-重建”范式移植到视觉:随机遮住图像绝大部分 patch,用非对称 encoder-decoder 重建缺失像素,从而在 vit 上实现可扩展、高效的自监督预训练。它证明了生成式掩码建模在视觉上不仅可行,且微调性能超越对比学习。
核心贡献
- 高掩码率(75%) 作为核心设计,而非语言中习惯的 15%。
- 非对称架构:encoder 只处理可见 patch,mask token 仅进入轻量 decoder,训练算力与显存大幅下降(3× 以上加速)。
- 简单像素重建目标,配合逐 patch 归一化,无需 tokenizer/离散码本即达 SOTA。
- 打通”大模型 + 大数据 + 自监督”的视觉可扩展路径:ViT-Huge 在 ImageNet-1K 微调达 87.8%。
关键机制与结果
为什么 75% 掩码率有效? 语言是高度语义、信息密集的离散信号,遮 15% 已足够难;图像在像素空间高度空间冗余——缺失 patch 常可由邻域低级插值补全。低掩码率会让任务退化为”局部纹理外推”,模型无需理解全局语义即可完成。只有把掩码率推到 75%,才迫使模型从稀疏可见线索中推断整体结构与语义,任务难度足够,学到的表征才有用。这是 MAE 与 bert 最本质的参数差异之源。
非对称 encoder-decoder。 Encoder 是标准 ViT,但只吃可见的 25% patch——因无需 mask token 占位,序列长度直接缩到 1/4,自注意力 O(n²) 成本骤降。Mask token(共享可学习向量 + 位置编码)只在 decoder 端插回完整序列。Decoder 可做得又浅又窄(如 8 层、512 维),因为它只服务预训练重建、下游即丢弃。这种不对称使 encoder 能扩到很大而总开销可控。
重建目标:像素 + 逐 patch 归一化。 MAE 直接回归原始像素(MSE)。关键增强是对每个 patch 内部做像素归一化(减均值除标准差,见 normalization),再作为回归目标。这提升了表征质量:归一化剥离了 patch 间的整体亮度/对比度差异,让模型聚焦相对结构与纹理而非绝对光度,等价于一种局部对比标准化的目标构造。
线性探针 vs 微调。 MAE 线性探针(冻结 backbone 接线性分类头)表现平平,但微调极强。这揭示其表征性质:MAE 学到的不是线性可分的高层语义簇(对比学习恰擅长此),而是丰富、非线性、可迁移的中层特征——需微调解锁。二者互补,说明”表征好不好”依赖评估协议。
为什么是里程碑
MAE 终结了”视觉自监督必须靠对比学习”的默认假设。相比 contrastive-learning / clip 依赖强数据增广、大 batch、负样本或动量编码器,MAE 无需这些工程负担,训练稳定且随模型规模持续增益。它为视觉确立了与 NLP 对齐的生成式预训练主线,直接启发后续大量掩码建模与多模态工作。
关联
与 bert 的异同。 同:随机掩码 + 重建缺失内容的自监督。异:①目标空间——BERT 预测离散 token(分类/交叉熵),MAE 回归连续像素(回归/MSE);②掩码率——15% vs 75%,源于语言信息密集 vs 图像空间冗余;③架构——BERT 对称(mask token 全程参与),MAE 非对称(encoder 不见 mask token)。
与 simmim / beit 的对照(掩码图像建模谱系)。 三者同属 MIM,核心差异在重建目标:MAE = 归一化像素(回归);simmim 同期独立工作,亦重建像素但用对称架构(encoder 处理全序列含 mask token,decoder 极简为单层预测头);beit = 预测 dVAE 得到的离散视觉码(分类,更像 BERT)。另有变体用 HOG 等手工特征作目标。谱系可按目标抽象度排列:像素 → HOG → 离散码,越离散越语义、越依赖外部 tokenizer;MAE 证明最简单的像素端也能顶尖。
与对比式 SSL 的对比。 contrastive-learning/clip 是判别式:拉近正对、推开负对,直接优化实例/跨模态可分性,线性探针强但依赖增广与负样本。MAE 是生成式:通过重建学习数据分布结构,微调强、工程简单。二者代表视觉 SSL 两条主线。
对 OCR / 文档的启示。 文档图像具有更强的结构冗余(版式、行列、留白),MIM 天然契合。dit(Document Image Transformer)即用类 BEiT 的掩码建模在海量无标注文档上预训练视觉编码器,为版面分析、表格/公式识别提供强 backbone。对”前端 DETR 检测 + 后端 AR 生成”的 OCR 路线,MAE 式自监督可为检测端的 vit 视觉编码器提供无标注预训练——尤其在文档域标注昂贵时,用非对称高效重建预训练编码器,再微调到检测/识别,是低成本获取强视觉表征的可行路径;归一化像素目标也提示:文档场景下按 patch 归一可抑制扫描光照不均,值得借鉴。