行业观察

前沿 AI 模型黑客能力飙升,激励与治理双重失衡暴露

Nathan Lambert 指出,多起前沿模型相关网络攻击事件暴露出 AI 行业激励错位与治理缺位:科技公司持续扩张能力边界,监管明显滞后,而具备更强持续执行能力的模型正成为新的安全变量。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
前沿 AI 模型黑客能力飙升,激励与治理双重失衡暴露

最近几起与前沿模型有关的网络入侵事件,让 AI 安全讨论从“会不会出问题”转向“什么时候大规模出问题”。Interconnects 作者 Nathan Lambert 在最新一期文章中直言,当下的技术激励和监管节奏都跑不赢模型自身的进化速度。

他把矛头对准两点:一边是模型厂商在增长压力下不断把能力推向新边界,另一边是政府侧的动作明显迟缓。结果是,模型在前沿攻击能力上的扩展速度,远快于外部世界的应对准备。

持续性更强的模型更可能变成攻击工具

Lambert 在文章中提出了一个技术层面的观察:模型在任务中的“持久性”越强,就越容易走出测试环境去执行真实攻击。所谓持久性,是指模型能多轮、长时间自主推进一项任务而不偏离或“自暴自弃”。

当模型能在一次任务里持续尝试上百个漏洞、自动串联多种工具链时,它就不再只是“写着玩”的安全产品,而更像一个可以挂上线的攻击代理。这一点和当前主流模型在 agent、多步推理上的投入方向密切相关。

推理时扩展放大了同一类风险

Lambert 特别提到 OpenAI 押注的推理时扩展(inference-time scaling)路径。简单说,就是给模型更多时间和算力去“想一想再回答”。这种方法让模型在数学、代码等任务上明显进步,但同样会强化持久执行能力。

也就是说,今天用来刷基准分数的技术杠杆,明天可能被用来跑一套完整的渗透流程。这是 OpenAI、Anthropic、DeepMind 等公司都在面对的统一问题,而不是某一家独有的麻烦。

厂商和监管,谁都没准备好

在 Lambert 看来,科技公司受营收和竞争驱动,几乎不会主动踩刹车;政府则受流程、立法节奏、人手限制,往往在模型已经公开发布一两年后才补上规则。

12 到 24 个月里,前沿模型的能力上限很可能再抬高一档,而围绕红队评估、滥用检测、能力报告的透明机制,目前还远没有成型。Lambert 认为行业至少需要把每一代模型的安全评估、危险能力测试结果放在更显眼的位置,而不是只披露跑分。

对开发者和企业用户意味着什么

对国内做 AI 工具集成的团队来说,这件事的现实提醒是:模型越像“能自己干活的同事”,越要给它加上行为边界。具体的工程动作包括限制长时任务的工具调用深度、引入人工审批节点、对敏感操作加白名单,而不是完全相信模型自治。

企业侧做选型时,除了看模型在客服、写作、代码任务上的指标,也值得问一句供应商:你们怎么测危险能力?发现模型会攻击系统时会怎么处理?这些现在还很少被问,但接下来 12 个月内会变得越来越常规。

给中文 AI 使用者的几点观察

对国内会翻墙找海外 AI 信息的开发者和研究者来说,重点不是去复现某个攻击流程,而是关注三件事:一是各厂商的安全评估报告开始公开哪些内容,二是推理时扩展是否会进入安全厂商的防御体系,三是监管侧会不会在欧美先出现一个“前沿模型强制披露”类的硬性要求。

Lambert 的结论其实很克制:他不是说模型一定会失控,而是说现在的激励结构既不奖励厂商放慢脚步,也不奖励监管提前出手,等到出事再补,已经太晚。对中文 AI 工具使用者来说,这种判断同样适用——别只看哪家模型更“聪明”,也要看哪家生态更愿意把安全流程摊开。

同主题阅读路径

查看「行业观察」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具