模型发布

蚂蚁Robbyant发布LingBot-VA 2.0:首个原生具身基础模型到底新在哪?

蚂蚁集团Robbyant团队发布LingBot-VA 2.0,号称首个原生具身基础模型,用因果DiT架构把视频与动作联合训练,训练提速2.3倍、延迟压到142ms,并在RoboTwin 2.0基准上拿下93%以上成功率。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
蚂蚁Robbyant发布LingBot-VA 2.0:首个原生具身基础模型到底新在哪?

蚂蚁集团旗下具身智能团队 Robbyant 近日正式发布 LingBot-VA 2.0,定位为"首个原生具身基础模型"。这不是一次常规的版本更新,而是把视频生成、动作预测和机器人控制放到同一套参数里联合训练,试图绕开"先训视觉再接动作"的传统拼接路线。

原生(native)的意思很直接:模型从一开始就把机器人视角下的视频、动作指令和时序因果关系当作一等公民,而不是把别人训好的视频模型当插件来调用。Robbyant 把这条路线走通,等于重新定义"基础模型"该长什么样

架构上,LingBot-VA 2.0 采用因果 DiT(Diffusion Transformer)结构,骨干视频专家参数约 130 亿,单次推理激活约 19 亿;整体训练规模约 153 亿参数,每 token 推理时激活约 25 亿。参数量不算夸张,但激活比例压得比较低,目标是同时兼顾表达力和推理成本。

核心信息与背景

工程上有两个数字值得记:一是多块预测(MCP)让训练速度提升约 2.3 倍;二是前瞻推理把延迟压到 142 ms / chunk。两者直接决定能否在真实机器人上跑得动——光跑分漂亮但延迟高、控制就跟不上

基准测试方面,模型在 RoboTwin

2.0 的 50 个任务上,干净演示数据和随机演示数据的平均成功率分别达到

93.8% 和

93.4%。两个数字几乎打平,说明模型对演示数据质量没那么敏感,泛化能力比较扎实

背景上看,Robbyant 是蚂蚁近两年在具身方向投入的主力团队,从早期的机器人导航到现在的视频-动作统一模型,走的是"自研基础模型 + 真实机器人数据"的路径。在国内 BAT 级别的公司里,愿意把具身基础模型作为独立产品线公开迭代的并不多

对用户的影响与后续观察

对机器人开发者来说,如果这套模型开放接口或权重,等于可以直接拿到一个"看视频就会做动作"的底座,省掉自建数据管线、训视频模型再接策略网络的一长串工程。对内容创作者而言,类似的视频预测能力也能被复用到数字人、虚拟主播等场景。

企业用户更关心延迟和部署成本。142 ms / chunk 在双臂操作场景中属于可接受范围,再叠上 MCP 的训练加速,企业自训行业版模型的周期会被显著压缩。但具体的开源协议、推理硬件要求和商业授权还没有完整披露,这是目前最大的不确定项。

中文用户眼下能做的,是先关注 Robbyant 是否同步放出技术报告、推理代码和 Demo 视频。海外华人社区对这类具身基础模型的讨论热度一直很高,配合中文技术博客的拆解,门槛会比纯英文论文低不少。

后续值得观察的点有三个:一是模型是否真的开源或开放 API;二是能否在真实硬件上复现 RoboTwin 2.0 的成绩;三是字节、阿里、腾讯等团队会不会在同一时间段拿出对标方案。在具身智能还没出现"安卓时刻"的阶段,每一步基础模型的更新都在划定新的起跑线。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具