商汤开源 SenseNova-Vision-7B-MoT:7B 模型打包十余项视觉任务
商汤近期开源视觉多任务模型 SenseNova-Vision-7B-MoT,配套发布 5000 万样本的 SenseNova-Vision Corpus。该模型统一了检测、OCR、GUI、深度与法线估计、分割、多视图等任务,并支持自然语言定义新任务,是少有的模型与数据同步全开放。

商汤近期在海外社交平台宣布,正式开源视觉多任务模型 SenseNova-Vision-7B-MoT,并同步放出配套的 SenseNova-Vision Corpus 训练数据集。这是商汤在多模态大模型方向上少有的一次模型与数据同步全开放。
核心能力:十余项视觉任务合一
官方信息显示,SenseNova-Vision-7B-MoT 不是一个专门模型,而是一个通用视觉底座。它把目标检测、OCR、GUI 理解、深度估计、法线估计、图像分割、多视图任务等十余种主流视觉能力塞进同一个模型。开发者不再需要为每个任务单独维护一套权重,部署侧压力会下降一个量级。
更值得注意的是自然语言定义任务的能力。模型允许通过自然语言描述来组装新任务,无需重新训练。这意味着很多传统上需要标注数据加微调才能完成的小众视觉需求,现在可以靠 prompt 试出来,对中小团队尤其友好。
开源内容与数据规模
本次开源包括两部分:一是模型权重,二是 SenseNova-Vision Corpus。语料库包含 5000 万高质量示例子集,以及一套复现剩余公开数据的完整工具链。换句话说,不只给你能跑的模型,还顺手把数据从哪来、怎么洗也讲清楚了。
5000 万样本已经接近工业级视觉数据集的门槛。配合工具链,中小研究者可以基于该数据子集做二次训练或下游适配,门槛比过去很多只发权重的开源项目低一截。
对开发者和企业的影响
对个人开发者而言,这是过去一年少有的一次下载、多任务可用的 7B 级视觉模型。7B 意味着消费级显卡(如 RTX 4090)有希望跑得动,部署门槛明显低于动辄 30B、70B 的同类方案。
对企业用户来说,OCR、GUI、深度估计这些任务本身就是文档自动化、智能客服、设备巡检等场景的刚需。如果 MoT 的自然语言任务定义足够稳定,企业有机会砍掉一批一个模型一个团队的视觉中台项目。
中文用户关注重点与后续观察
首先看任务列表里有没有自己场景的对应能力。MoT 的核心卖点是覆盖广,但对具体任务的效果,仍需在自己数据上跑基准,不能只看官方榜单。
同时关注自然语言任务定义的稳定性。官方强调无需重训是新卖点,但实际工程中 prompt 漂移和任务边界模糊是常见问题,企业级落地需要专门评估。
后续值得看三件事:社区复现情况(5000 万样本加工具链是否真能跑通同等级别模型)、下游微调生态(是否有团队微调出更强的垂直模型),以及商用边界。企业落地前最好先确认权重许可、衍生模型归属、再分发限制等细节,避免踩到协议里的隐性条款。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具