产品动态

斯坦福推出 Terminal-Bench-Science 0.1:70 道硬核任务,专门给科研 AI 智能体出考卷

斯坦福领衔的团队发布 Terminal-Bench-Science 0.1,用 70 个跨学科任务考核 AI 智能体在真实科研工作流中的能力,挑战现有模型在生命、物理、地球、数学和工程等领域的短板。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
斯坦福推出 Terminal-Bench-Science 0.1:70 道硬核任务,专门给科研 AI 智能体出考卷

最近 AI 圈又冒出一个专门“为难”智能体的考卷:Terminal-Bench-Science 0.1。这套基准由斯坦福大学研究人员牵头推出,把目光直接对准了科研工作流,而不是聊天、写作这种通用场景。

和过去那些用选择题或者对话题衡量模型的基准不同,Terminal-Bench-Science 想测的是一件事:AI 智能体到底能不能像科研人员一样,跑代码、看数据、得出结论?

70 道跨学科考题覆盖五个领域

这套 0.1 版本一共准备了 70 个任务,全部由相关学科的专家挑选和编写。覆盖范围包括生命科学、物理、地球科学、数学以及工程科学,都是典型的需要动手跑计算、写脚本、调参数的科研环节。

任务设计的重点不是“你知不知道”,而是“你能不能做出来”。智能体需要真的进入终端环境,自己写命令、运行程序、处理报错,最终给出一个可验证的答案。这种考核方式更接近研究生或者工程师日常的真实工作流。

跟此前的 AI 科研基准有什么不同

过去几年,科研类基准大多停留在问答层面,比如让模型解释一个概念,或者复述一段论文内容。这种测法容易被“答题套路”刷高分数,掩盖模型在动手能力上的不足。

Terminal-Bench-Science 的思路是“过程可见、结果可验”。智能体每一步操作都留痕,最终答案要么是数值,要么是代码输出,要么是结构化结论,主观判卷的空间被大幅压缩。

对做 AI Agent 的人来说意味着什么

对国内做科研 Agent、代码 Agent 的团队来说,这套基准的参考价值在于:它明确划出了“能跑通”和“真有用”之间的差距。如果一个智能体在这 70 道题上表现稳定,那它在真实的科研助理场景里才值得被信任。

另一方面,这种任务型基准比单纯的对话评测更吃工程能力,提示词设计、工具调用、错误恢复这些环节都会被真实地检验出来。

中文用户应该关注什么

对国内的研究者和学生来说,这套基准暂时还主要是英文任务,但任务结构并不依赖语言,迁移到中文科研环境里并不困难。后续如果有人做中文版或者垂直领域版本,比如生物信息、材料模拟、量化交易,是值得跟进的落地方向。

对普通 AI 工具使用者来说,这条新闻的意义在于:AI 能不能在科研这种高门槛场景里“顶用”,目前还远没有定论。别被营销话术忽悠,真正的科研能力仍然需要用真实任务去验证

后续值得观察的几点

第一,主流大模型在 0.1 版本上的得分情况会很快公开,谁能跑过半数、谁会在哪个学科先翻车,是接下来一两周内值得追踪的信号。

第二,团队是否会开放任务数据和执行轨迹。一旦开放,国内做 Agent 训练和评测的团队就有了一个高质量的参考样本。

第三,这套基准会不会被接入到现有的 AI 编程助手或科研平台里。如果某家模型厂商直接把它写进自家产品宣传,那基本可以判断它对自己的科研能力是有底气的。

科研 Agent 的竞赛,才刚刚开始。能不能帮研究生少熬几个夜、能不能替工程师更快地跑出结果,是接下来一年里最值得盯的实战考题。

同主题阅读路径

查看「产品动态」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具