面壁智能开源 MiniCPM-Robot:1.5B 参数 VLA 模型把具身 AI 拉到端侧
面壁智能开源 MiniCPM-Robot 系列,含 1.5B 参数的通用 VLA 模型与目标跟踪模型,并配套推理框架 PhyAI。这是国内少有把"小模型 + 具身"同时摆出来的组合,为机器人开发者提供了低门槛工具链。

面壁智能把具身智能的门槛又往下拉了一档。他们刚刚开源了 MiniCPM-Robot 系列,包含一个 1.5B 参数的视觉-语言-动作(VLA)模型 MiniCPM-RobotManip 和一个目标跟踪模型 MiniCPM-RobotTrack,同时配套一个叫 PhyAI 的推理框架。
这是国内大模型公司里,少有把\
同时摆出来的组合。1.5B 在 VLA 圈算轻量级,过去几个月讨论度高的同类模型大多在 7B 以上。面壁的逻辑很直接:机器人端侧算力有限,模型必须先压得动,再谈能不能用。
这次到底放出了什么
三个东西。MiniCPM-RobotManip 是主力,定位通用 VLA,把摄像头画面、语言指令和机械臂动作打通;MiniCPM-RobotTrack 偏感知,负责在视频流里持续锁定目标物体;PhyAI 是底层推理框架,号称要把延迟和吞吐做上去。
三个组件拆开看,分工清晰:感知、决策、执行三段都有对应模块。1.5B 的 VLA 能不能真正在真实机械臂上跑稳,是这次开源最值得验证的事。
为什么是面壁做这件事
面壁智能从 MiniCPM 开始就一直打\
的路线,从端侧 LLM 到端侧多模态模型,主战场就是边缘设备和低算力平台。机器人正好是这条路径最自然的延伸——主控芯片算力普遍有限,云端来回延迟也吃不消。
行业里现在做具身智能的团队不少,但愿意把 VLA 模型、目标跟踪模型、推理框架一次性全开源的并不多。面壁这步有点像把\
摊在桌面上,等着开发者来填具体场景。
对开发者和企业用户意味着什么
对机器人开发者来说,最直接的好处是少走一步路。不用再从零训练 VLA,可以基于 MiniCPM-RobotManip 做微调,对接自家机械臂或移动底盘。MiniCPM-RobotTrack 则补上了一块很多开源项目缺的目标跟踪能力。
对企业用户,值得关注的不是参数大小,而是部署成本和可改造空间。1.5B 模型在一张中端 GPU 甚至部分工业级 NPU 上都有跑起来的可能,比动辄需要多卡集群的方案更贴近产线预算。
不过,开源不等于开箱即用。VLA 模型通常需要针对具体机械臂构型、相机标定和动作空间做适配,工程量不小。把它当\
理解更准确。
中文用户该看什么、接下来盯什么
如果你正在做机器人或具身方向的研究,最该优先看的三件事:模型在公开基准上的成绩、PhyAI 框架的实际延迟数据、社区是否有人在工业场景里跑出可复现的 demo。GitHub 上的 issue 和 PR 活跃度,往往比官方放出的测试数据更说明问题。
后续值得观察的点包括:是否有头部机器人公司接入这套方案做产品;1.5B 这个量级在更复杂任务上会不会遇到明显的天花板;以及推理框架 PhyAI 是否会扩展支持更多硬件平台,比如国产 NPU。
总体看,面壁这次的动作不是单点放出一个模型,更像是把\
做成一个可被使用的开源工具链。对中文 AI 社区来说,这意味着做机器人应用不再需要从底层一点点搭起。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具