首页 > 教程攻略 > ai资讯 >视觉模型新突破:商汤开源 SenseNova-Vision-7B-MoT

视觉模型新突破:商汤开源 SenseNova-Vision-7B-MoT

来源:互联网 时间:2026-07-14 14:51:23

最近AI圈又有了新的大动作——商汤科技正式开源了一款多任务视觉模型,名叫SenseNova-Vision-7B-MoT。这玩意儿可不简单,它的定位是为视觉理解和GUI智能体开发提供一块足够结实的“地基”。

简单来说,这个模型最厉害的地方在于它的任务整合能力。你想想,目标检测、OCR(光学字符识别)、深度估计、法线估计、图像分割、多视图处理……这些原本需要各自独立训练的视觉任务,现在被塞进了一个只有7B参数规模的模型里。统一集成还不够,它还支持通过自然语言定义全新的视觉任务变体,相当于把各种视觉能力像乐高一样拆开重组,突破了传统任务边界的限制。

image.png

更让人眼前一亮的是商汤这次的开源策略——完全开放,毫无保留。开发者不仅能拿到模型权重,还能获得一个包含5000万个样本的语料库子集(SenseNova-Vision语料库),以及一套完整的复现工具包,用来处理剩下的公开数据。这等于说,社区拿到的不只是一个模型,而是一整套可以动手玩、能复现结果的生产工具。

业内专家对这个模型的评价不算低——它不只是一次简单的轻量化模型迭代,而是给视觉理解任务提供了一个更有扩展性的统一框架。目前,模型的技术细节、代码仓库和演示空间都已经在Hugging Face、GitHub这些平台上上线了。科研人员和开发者可以直接上手调用,加快技术落地的节奏。