RLHF 作者亲历:AI 改得了稿,却搭不出一章书
知名 RLHF 研究者 Nathan Lambert 写完教科书后反思:当前大模型在长文非虚构写作上几乎原地踏步,编码和数学任务却已接近超人水平。他点出 GPT-4.5、Kimi K2 等写作模型正在老化,长文结构仍是 AI 写作的真正短板。

RLHF 领域的知名研究者 Nathan Lambert 最近完成了一本关于强化学习人类反馈的教科书。书稿落地后,他没有立刻庆祝,而是抛出一个让人意外的判断:当前的大模型在长文非虚构写作上几乎原地踏步。
长文写作为什么卡住了
他在文章里指出,今天的 LLM 已经能稳妥处理错别字、句式润色和局部改写,但一旦要把整章内容组织起来,模型就开始混乱:章节逻辑跑偏、前后重复、关键论据漏掉。这种短板不是细节问题,而是结构性的。
Lambert 给出的结论很直白:改稿容易,搭骨架难。这意味着大多数 AI 写作工具的天花板,目前仍然停留在润色和纠错层面,而不是真正的内容生成。
写作模型正在显露老态
他特别点名了几个曾经被视为写作强模型的产品,包括 GPT-4.5 和月之暗面的 Kimi K2。在 Lambert 看来,这些模型在长文任务上的吸引力正在下降,社区里越来越少有人把它们当作写作首选。
这种老化感并非错觉。同一时期,编码、数学、代码 Agent 等方向不断刷新基准,新模型在这些任务上的表现已经接近或超过人类专家。写作任务却几乎没迎来对应的代际跃迁。
与编码、数学的对比
差距背后是任务本身的性质。编码有测试用例、数学有标准答案,模型可以通过验证器持续自纠;长文非虚构写作的对错难以形式化,RLHF 给出的反馈信号也偏弱,模型很难判断自己组织得是否合理。
这也解释了为什么 AI 在写代码、解奥赛题上频频出圈,在写书、写教材这类任务上却一直拿不出让人信服的整体方案。
对中文用户意味着什么
对中文写作者来说,这个判断有两层意义。首先,AI 现阶段更适合做编辑助理,而不是独立作者;可以让它改稿、润色,但把整本书交给它仍然冒险。其次,可以关注针对长文结构能力的新评测,一旦有团队发布相关基准,值得第一时间试用。
具体到工具选择,月之暗面、智谱、Anthropic、OpenAI 等厂商近期如果推出长文写作相关更新,可以重点对比章节连贯性、事实一致性和大纲稳定性三个维度。
值得继续观察的方向
后续有三个信号值得跟踪。一是各家模型是否会在长上下文基础上推出专项能力,例如自动大纲、章节自检;二是 RLHF 之后是否有新的训练范式,专门解决长文组织问题;三是开源社区是否会复现 Lambert 提到的写作基准,让中文用户也能本地跑测试。
对 AI 工具的日常使用者来说,最务实的结论只有一条:现阶段,让模型帮你写一段,不要让它写一本书。把这句话当成使用边界,比任何花哨的功能演示都管用。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具