首页 > 教程攻略 > ai资讯 >商汤开源SenseNova-Vision统一视觉大模型,单模型横扫四大核心视觉任务

商汤开源SenseNova-Vision统一视觉大模型,单模型横扫四大核心视觉任务

来源:互联网 时间:2026-07-14 15:11:06

商汤科技最近放了个大招——正式发布并全面开源了"日日新SenseNova-Vision"理解生成统一视觉大模型。这次升级,直接瞄准了视觉能力在大模型体系中的核心地位。过去行业里讲的"统一视觉",说白了就是把检测、分割、深度预测这些专家模型打包在一起,本质上还是各干各的、割裂的。而SenseNova-Vision真正让视觉成为通用基础模型的原生能力,彻底融入了大模型体系。

image.png

在分割能力这块,它同时覆盖了通用分割、推理分割、交互式分割等多个方向。得益于强大的多模态理解能力,推理分割和对话式分割的表现尤其让人眼前一亮。更关键的是,仅凭一个模型就能高质量完成多视角点云重建和相机位姿估计,性能在通用视觉路线中已经处于领先位置。

全面超越Vision Banana,数据同步开源

横向对比来看,和语义导向模型比,SenseNova-Vision在检测、分割、深度这些细节要求极高的视觉任务上实现了全面领先。再对比生成导向模型Vision Banana,优势就更明显了——在各项权威评测的绝大多数指标上,SenseNova-Vision都实现了超越和领跑。Vision Banana只能应对四大核心板块中的两类问题,而SenseNova-Vision却能同时覆盖结构化理解、稠密几何、全景分割、多视角3D等全任务,差距一目了然。

在开源方面,商汤不仅开放了模型本身,还同步开源了包含5000万条样本的视觉指令语料库SenseNova-Vision Corpus-50M。未来,商汤还将把SenseNova-Vision的核心技术全面融入日日新U系列大模型中。