首页 > 教程攻略 > ai教程 >商汤发布旗舰级SenseNova U1 Pro,多模态智能体实现长程任务闭环

商汤发布旗舰级SenseNova U1 Pro,多模态智能体实现长程任务闭环

来源:互联网 时间:2026-07-19 07:08:49

多模态AI的进化,终于走到了一个关键转折点——从“抽卡”式的随机生成,转向真正能交付作品的系统级能力。

图片来源:商汤科技

7月18日,2026世界人工智能大会(WAIC)上,商汤科技正式发布了旗下大模型家族的新旗舰——SenseNova U1 Pro(以下简称U1 Pro)。作为“日日新 SenseNova U”系列的顶配版本,U1 Pro的定位很明确:面向长程任务的交付级原生多模态智能体基座,真正把理解、生成和行动捏合在一起。在原生统一架构的基础上,视觉创作领域做了深度迭代,让复杂图片创作能力直接对标全球顶尖模型的“交付级”水准。

商汤给出一个判断:U1 Pro的发布,意味着多模态AI进入“长程演进”的新阶段。行业正在告别过去那种单点式内容生成(Generation),全面转向能够闭环完成复杂、长程任务的系统级内容交付(Delivery)。

商汤科技联合创始人、首席科学家林达华打了个比方——代码产品已经走通的路径,多模态产品正在重走一遍:从Copilot工具辅助,到Vibe Coding意图驱动,再到Agentic Coding系统级任务交付。多模态的进化也类似:

第一阶段解决“真实感生成”的问题;

第二阶段能够用自然语言交互并持续修改,实现多模态创作进阶;

第三阶段则是在真实场景中直接完成“交付级”创作,设计美感和内容精准兼顾,彻底告别反复抽卡的困境。

但问题在于:能交互,不等于能交付。旗舰版U1 Pro给出了四大核心交付能力:巅峰设计美感,彻底甩掉“AI味”;原生8K超清输出;极致的图文与细节控制;长程Agentic闭环思维——说白了,就是让AI不再只是“画个图给你看”,而是能按要求把活儿干完、干好。

之所以能突破“生成”边界、走向“稳定交付”,底层核心在于NEO-unify内核架构。这个架构在原生多模态体系中实现了语言和视觉的统一表征,打破了理解与生成之间长期存在的割裂壁垒。

商汤今年4月开源了基础模型SenseNova U1,开源两个多月以来,在真实高强度工作流中表现不错。今年6月,U1的用户人均日生图量相比5月提升了近3倍——说明模型已经深度切入真实应用工作流。截至7月中旬,U1以及集成了U1能力的SenseNova-Skills代码库在GitHub上的总Star数突破8000。

同时,商汤还开源了SenseNova-Vision统一视觉大模型,基于原生统一架构,让实例分割、目标检测这些经典视觉任务直接成为通用大模型的原生能力,告别了传统“多专家模型拼凑”的局限。

在考验系统级交付实力的高难度场景中,U1 Pro主攻三个方向:美学叙事、逻辑控制,以及硬核数据推理。比如在复杂视频创作任务中,模型不再靠随机抽卡拼凑镜头,而是先自主规划并生成整体视觉蓝图——包括剧情世界观、主角与敌人人设、服装武器、沙漠环境色调——然后一次性输出多达22个逻辑一致的连续分镜。在此基础上,配合商汤的视频工具,实现了人物、剧情和视觉语言的高度可控交付。

《沙影之刃》世界观设定 & 22镜分镜总览

在可落地的商业化场景上,作为通用多模态基座,U1 Pro正在重塑办公、电商、教育等生产单元。目前已经在商汤旗下的产业级AI“小浣熊”和视频创作工具“Seko”中得到验证——数以千万计的个人用户,接近一万家企业用户,以及大批AI原生组织,正在把自身经验、兴趣和创意转化为可规模化复用的真实交付成果。

U1 Pro的预览版本目前已经开启邀请测试,后续会随着推理服务资源扩大逐步放开。正式版本将在今年8月上线,对公众开放服务,届时会同步推出定价和API服务。