数据质量优先(Data Quality over Scale)

核心主张

挑战「更大即更强」的 scaling 教条:与其无脑堆规模,不如把数据做到教科书级高质量——精心筛选 + 合成高质量样本,能让小得多的模型/数据量达到甚至超过大模型的性能。代表作 phi-1(1.3B 参数、极小高质代码数据,HumanEval 超过大得多的模型),及后续 phi 系列。

为什么有效

  • 信息密度:网络爬取语料噪声大、重复多、教学价值低。教科书式数据每个 token 的「学习价值」高,模型用更少样本就能学到清晰的概念与推理模式。
  • 分布对齐:合成数据可主动覆盖目标能力所需的样例分布(如各类练习题),减少无关内容干扰。
  • 可控性:能针对性补齐长尾、难样本、特定格式,而不是被动接受爬取分布。

方法要素

  1. 用强模型/规则从海量原始数据里筛选出高质量子集(分类器打分)。
  2. 用强模型合成教科书式讲解 + 练习(source-of-truth 生成)。
  3. 强调多样性 + 难度覆盖,避免合成数据同质化。

风险与边界

  • 合成数据易同质、可能继承教师模型偏差与幻觉,需去重与质量校验。
  • 「小数据也能强」在窄领域(代码/数学)最明显,通用宽域仍受益于规模。

对 OCR/文档智能的启示(本 wiki 重点)

在 OCR 模型训练中,这条对领域数据合成有直接价值:与其堆海量弱标注文档,不如构造高质量、覆盖难版面/多语种/表格公式的合成语料。相关专题见 synthetic-data-for-ocr、手写合成 handwriting-synthesis、降标注依赖路径 label-efficient-ocr。