数据质量优先(Data Quality over Scale)
核心主张
挑战「更大即更强」的 scaling 教条:与其无脑堆规模,不如把数据做到教科书级高质量——精心筛选 + 合成高质量样本,能让小得多的模型/数据量达到甚至超过大模型的性能。代表作 phi-1(1.3B 参数、极小高质代码数据,HumanEval 超过大得多的模型),及后续 phi 系列。
为什么有效
- 信息密度:网络爬取语料噪声大、重复多、教学价值低。教科书式数据每个 token 的「学习价值」高,模型用更少样本就能学到清晰的概念与推理模式。
- 分布对齐:合成数据可主动覆盖目标能力所需的样例分布(如各类练习题),减少无关内容干扰。
- 可控性:能针对性补齐长尾、难样本、特定格式,而不是被动接受爬取分布。
方法要素
- 用强模型/规则从海量原始数据里筛选出高质量子集(分类器打分)。
- 用强模型合成教科书式讲解 + 练习(source-of-truth 生成)。
- 强调多样性 + 难度覆盖,避免合成数据同质化。
风险与边界
- 合成数据易同质、可能继承教师模型偏差与幻觉,需去重与质量校验。
- 「小数据也能强」在窄领域(代码/数学)最明显,通用宽域仍受益于规模。
对 OCR/文档智能的启示(本 wiki 重点)
在 OCR 模型训练中,这条对领域数据合成有直接价值:与其堆海量弱标注文档,不如构造高质量、覆盖难版面/多语种/表格公式的合成语料。相关专题见 synthetic-data-for-ocr、手写合成 handwriting-synthesis、降标注依赖路径 label-efficient-ocr。