模型发布

RLHF 作者亲历:AI 改得了稿,却搭不出一章书

知名 RLHF 研究者 Nathan Lambert 写完教科书后反思:当前大模型在长文非虚构写作上几乎原地踏步,编码和数学任务却已接近超人水平。他点出 GPT-4.5、Kimi K2 等写作模型正在老化,长文结构仍是 AI 写作的真正短板。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
RLHF 作者亲历:AI 改得了稿,却搭不出一章书

RLHF 领域的知名研究者 Nathan Lambert 最近完成了一本关于强化学习人类反馈的教科书。书稿落地后,他没有立刻庆祝,而是抛出一个让人意外的判断:当前的大模型在长文非虚构写作上几乎原地踏步。

长文写作为什么卡住了

他在文章里指出,今天的 LLM 已经能稳妥处理错别字、句式润色和局部改写,但一旦要把整章内容组织起来,模型就开始混乱:章节逻辑跑偏、前后重复、关键论据漏掉。这种短板不是细节问题,而是结构性的。

Lambert 给出的结论很直白:改稿容易,搭骨架难。这意味着大多数 AI 写作工具的天花板,目前仍然停留在润色和纠错层面,而不是真正的内容生成。

写作模型正在显露老态

他特别点名了几个曾经被视为写作强模型的产品,包括 GPT-4.5 和月之暗面的 Kimi K2。在 Lambert 看来,这些模型在长文任务上的吸引力正在下降,社区里越来越少有人把它们当作写作首选。

这种老化感并非错觉。同一时期,编码、数学、代码 Agent 等方向不断刷新基准,新模型在这些任务上的表现已经接近或超过人类专家。写作任务却几乎没迎来对应的代际跃迁。

与编码、数学的对比

差距背后是任务本身的性质。编码有测试用例、数学有标准答案,模型可以通过验证器持续自纠;长文非虚构写作的对错难以形式化,RLHF 给出的反馈信号也偏弱,模型很难判断自己组织得是否合理。

这也解释了为什么 AI 在写代码、解奥赛题上频频出圈,在写书、写教材这类任务上却一直拿不出让人信服的整体方案。

对中文用户意味着什么

对中文写作者来说,这个判断有两层意义。首先,AI 现阶段更适合做编辑助理,而不是独立作者;可以让它改稿、润色,但把整本书交给它仍然冒险。其次,可以关注针对长文结构能力的新评测,一旦有团队发布相关基准,值得第一时间试用。

具体到工具选择,月之暗面、智谱、Anthropic、OpenAI 等厂商近期如果推出长文写作相关更新,可以重点对比章节连贯性、事实一致性和大纲稳定性三个维度。

值得继续观察的方向

后续有三个信号值得跟踪。一是各家模型是否会在长上下文基础上推出专项能力,例如自动大纲、章节自检;二是 RLHF 之后是否有新的训练范式,专门解决长文组织问题;三是开源社区是否会复现 Lambert 提到的写作基准,让中文用户也能本地跑测试。

对 AI 工具的日常使用者来说,最务实的结论只有一条:现阶段,让模型帮你写一段,不要让它写一本书。把这句话当成使用边界,比任何花哨的功能演示都管用。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具