预训练效率到底靠什么?一份六年复现实验把答案指向数据
Dwarkesh Patel 团队发布预训练复现实验:从 2019 到 2025 的代表性配方面对同一算力预算时,数据改进贡献了 12 倍效率提升,模型架构改进只有 3.7 倍。结论直白——数据质量与配比仍是眼下最划算的杠杆。

最近 AI 圈一份有意思的复现实验,来自播客主 Dwarkesh Patel。他和团队把 2019 到 2025 年间几套具有代表性的模型配方与数据组合,重新在同一算力预算下训练一遍,直接比较“数据”和“模型架构”各自的贡献。
实验上限被刻意压到 1e19 FLOPs,目的是贴近大多数中型实验室的现实预算,而不是头部公司动辄万卡级别的算力。结果非常直白:**数据改进带来了约
12.0 倍的算力效率提升,模型架构改进只有约
3.7 倍**,数据贡献约为模型的
3.24 倍。
换句话说,过去六年公开口径上的预训练进步,主要不是来自新架构奇思,而是来自“给模型喂更好的数据、更干净的数据、更合理的配比”。这并不新鲜,但难得的是,它第一次有了一个相对干净、可复现的实验支撑。
这份实验做了什么
他们没有去挑战 GPT-5、Gemini 这类超大模型,而是选了六个时间节点的代表配置,分别对应不同年份的主流思路。每组配置都在同一套算力下训练,覆盖同样的 token 量,区别只在于模型结构与训练数据组成。
为了避免单一数据源偏差,实验既包含更老的小模型配方,也包含 2024 到 2025 年公开的较强基线。衡量标准也不是单次跑分,而是多次不同随机种子下的中位数,确保结论不至于被一次好运拉偏。
结果以“等效算力”来表达,也就是同样的下游损失,需要多少倍 FLOPs 才能复现。这种衡量方式对工程团队更直接——你能直接换算成“同样的钱能多训出多少效果”。
为什么数据贡献被压倒
这一代模型架构本身已经接近成熟。Transformer 及其变体之间的差距,更多体现在细节优化、归一化、注意力变体等小修小补。这些当然有用,但很难再拉开指数级差距。
反观数据,过去几年发生了三件事:合成数据的成熟、高质量语料的清洗流水线化、以及“代码 / 数学 / 长文档”这种结构化配比的精细调优。这些都能直接转化为训练效率。
更现实的是,开源社区和中小团队可以大量复用的高质量预训练语料越来越多,而想换一个更大的模型往往意味着全部重新训练,成本根本不在一个量级。数据是杠杆,模型是奢侈品——预算有限的人当然先压前者。
对中文开发者和内容团队意味着什么
对国内独立开发者和中小团队来说,这个结论相当友好。如果你正在做行业大模型、企业知识助手或中文垂直模型,与其重金研究新架构,不如把预算花在数据治理上。
数据清洗、配比实验、可追溯的合成数据流水线这三件事,会比换一个花哨的注意力变体更快看到效果。对内容创作者而言,私域语料、结构化 Q&A、长文档片段,这些长期被低估的资产,正在成为模型能力的天花板。
后续值得观察的点
首先,这份实验把算力上限压在 1e19 FLOPs,更大规模下“模型贡献”会不会追上来,还不清楚。万亿 token、千亿参数一级的训练里,新架构收益未必还是 3.7 倍,可能更高,也可能在长上下文、推理任务上特别显著。
其次,实验用的是英文为主、混部分多语言的数据语料,对纯中文语料的迁移效应如何,目前没有直接证据。国内团队如果想照搬结论,最好先做一次小规模中文复现。
最后,合成数据的边界还没摸清。当大家都在用模型生成语料去训下一代模型,循环污染会不会抵消这些效率收益,是 2025 年下半年最值得盯的一个变量。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具