Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(2019/2020)— 深度精读
📄 原文:arXiv:1910.10683 · PDF
把所有 NLP 任务(分类、翻译、摘要、问答、回归)统一成「文本进、文本出」,用一个 encoder-decoder Transformer 系统性对比预训练目标/架构/数据/规模,最终以 11B 模型 + C4 语料刷新 18/24 项 SOTA。
一句话定位
T5 用「text-to-text」大统一框架把整个 NLP 迁移学习空间做成可控消融实验,得出一套「最佳实践配方」,并把它放大到 11B 参数验证。
核心贡献
- Text-to-Text 统一范式:连回归任务(STS-B 相似度)都转成生成数字字符串;任务用文本前缀区分(如
translate English to German:)。单一模型、单一损失、单一解码流程通吃所有任务。 - C4 语料(Colossal Clean Crawled Corpus):从 Common Crawl 清洗出约 750 GB 干净英文文本,配套过滤启发式(去噪声/去重/语言过滤),作为 TensorFlow Datasets 公开。
- 系统性消融:把预训练目标、架构(encoder-decoder vs 语言模型 vs 前缀 LM)、无标注数据、迁移策略、规模等做组合式对照实验,给出可复用结论。
- Span-corruption 目标:受 SpanBERT 启发,遮盖连续 span、用单个 sentinel token 替换,目标序列只输出被丢的 span(比逐 token 更短更高效)。
架构 / 方法细节
- 架构:标准 encoder-decoder Transformer(近似原版 Vaswani 2017),发现它优于纯 decoder LM。Base 约 220M 参数(≈2×BERT-BASE,因有两个 stack)。
- 目标细节:随机丢弃 15% token,最优平均 span 长度 = 3;消融显示 corruption rate 15%/25%/50% 差异有限,仍选 15%;BERT-style objective 最佳,prefix-LM 次之,标准 LM 明显更差。
- 规模谱系:Small 60M(d=512, 6层)、Base 220M、Large 770M(≈BERT-LARGE, 24层)、3B(d_ff=16384, 32头, 2.8B)、11B(d_ff=65536, 128头)。刻意放大 d_ff 因 TPU 对大密集矩阵乘最高效。
- 最终训练:batch=2¹¹ × 512 长度序列 × 1,000,000 步 ≈ 1 万亿 token(约 baseline 的 32×);不重复数据;优化器 AdaFactor,预训练用 inverse-sqrt lr、微调用常数 lr。
- Multi-task 预训练:混合有监督+无监督任务,用 example-proportional mixing(各规模设人工数据量上限),效果≈纯无监督预训练且可全程监控下游指标。
- 微调技巧:GLUE/SuperGLUE 分任务微调时用小 batch=8、每 1000 步存 checkpoint 防低资源任务过拟合;长输出用 beam=4、length penalty α=0.6。
关键结果(真实数字)
- 总体:24 项任务中 18 项 SOTA;11B 是关键,规模放大是最重要因素。
- GLUE:平均 90.3(提交过最大参数模型),MNLI/RTE/WNLI 大幅超前;RTE/WNLI 是历史上机器落后人类的任务(人类 93.6/95.9)。
- SQuAD:EM 超前 ALBERT >1 分。
- 对比 ALBERT:ALBERT 需集成 6–17 个模型;T5-11B 单模型即达到相当水平,推理更省。
为什么是里程碑
- 用严格实验把「迁移学习配方」标准化,成为后续 LLM 训练的默认参考(目标、数据清洗、规模策略)。
- Text-to-text 统一接口影响深远(后续 FLAN、UL2、指令微调都沿用)。
- C4 成为学术界最常用的开放预训练语料之一。
关联
- encoder-decoder 骨架源头:attention-is-all-you-need、seq2seq
- 双向掩码目标对照:bert
- 纯 decoder few-shot 对照:gpt3
- 缩放策略后被修正:chinchilla
- 数据清洗质量优先的先声:data-quality-over-scale、textbooks-are-all-you-need