模型发布

Anthropic 联手 Andon Labs 推 Drone-Bench:用仿真考 AI 操控无人机找人

Anthropic 与 Andon Labs 推出 Drone-Bench 评测基准,把室内定位追踪拆成五个子任务,通过软件复现评估 AI 模型自主操控无人机能力,足以区分不同智能水平的模型。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Anthropic 联手 Andon Labs 推 Drone-Bench:用仿真考 AI 操控无人机找人

Anthropic 与机器人实验室 Andon Labs 联合推出了 Drone-Bench,一套专门评估 AI 模型自主操控四旋翼无人机能力的基准。它把「室内环境定位并追踪指定人员」这种复合任务拆成五个子步骤,借助软件复现来快速打分。这不是一次无人机产品发布,更像是给「AI 能不能动手干活」出了一张新考卷。

Drone-Bench 到底在测什么

Drone-Bench 不依赖真实飞行,用仿真环境复现空间遮挡、光照变化和多机协同难度。它把任务链切成 3D 地图重建、定位、导航、目标检测和持续跟随,每个环节都有独立评分指标。受测模型要在零人工干预下,自行把「我在哪、目标在哪、怎么绕过去、盯住他」整串决策串起来。这是一个端到端的链条测试。

这样设计的好处很直接:真实试飞成本高、风险大,还牵扯空域问题;仿真可以让研究者在几小时内跑完上千次场景,对比不同模型在物理操控类任务上的真实差距。对实验室和模型厂商来说,等于把跑道搬进了一台服务器。

模型表现:难度足以拉开档次

从已公开的实验结果来看,这套任务链的难度足以把当前主流模型的智能水平拉开档次。能跑通 3D 建图不等于能跟住人,能跟住人不等于能在多层房间之间反复穿行。它比的不是「会不会飞」,而是「能否在陌生空间里持续完成整条任务」。

这种「分任务—独立打分—横向对比」的思路,与最近两年流行的 Agent Benchmark 一脉相承。可以把它看成是从语言理解、网页操作延伸向真实三维空间的一次跃迁。AI 的考试范围正在进入它自己的「双手双脚」。

对做机器人、巡检、低空经济的团队来说,Drone-Bench 提供了一个公开对照表——以前各家自吹自擂,现在可以放在同一张仿真地图里 PK。这对模型选型、合作方评估、技术路线选择都有直接参考价值。

对安防、物流、应急这类 B 端场景来说,这是一次早期信号。当 AI 能在仿真里完成定位—导航—跟踪整条链路,再迁移到真实硬件上,「半自主无人机巡检」就不再只是 PPT。不过从仿真到真正的现实飞行,还要跨过传感器、算力、监管三道关。

中文用户可以跟进什么

对国内 AI 从业者和工具使用者来说,这不意味着马上能拿到一个无人机 Agent。但值得关注的是:Anthropic 把仿真环境、任务定义、评分方法都公开了——对做具身智能研究的同学,这是一把难得的可对照的尺子

如果你想跟上节奏,可以盯着三件事:

一是 Drone-Bench 后续是否接入 Claude、Gemini、GPT、国产开源等更多主流模型;

二是仿真任务是否会扩展到室外、多机协作、动态障碍等更复杂链路;

三是基于它的衍生工作是否会反哺到真实的无人机部署里。

最后值得记住一点:仿真里表现好,不等于现实空间里一定可靠;目标检测又涉及隐私采集,这类基准的伦理边界和数据规范才刚刚开始被讨论。短期内它不会改变你的日常工作流,但会让「AI 到底能不能走进物理世界」这个问题的答案变得更快可见。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具