首页 > 教程攻略 > ai资讯 >原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化

原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化

来源:互联网 时间:2026-08-04 13:17:13

商汤科技在原生统一多模态领域持续深耕,继今年4月发布SenseNova U1后,近日正式开源了其轻量级预览版——SenseNova U1.5-Lite-Preview。这一版本并非简单的规模升级,而是基于NEO-Unify架构的一次系统性迭代,旨在将强大的视觉理解、推理、生成与编辑能力,以仅8B-MoT的轻量级规模,推向更高分辨率、更逼真质感与更复杂交互控制的新高度。

核心能力:从“理解”到“创作”的全链路贯通

U1.5-Lite-Preview保留了U1在同一模型中联合建模语言、视觉语义与像素生成的核心能力,现在更将图像生成与编辑能力推向新高度。其关键特点在于:

  • 原生统一架构

    :打通语言描述到视觉结构的原生映射,实现真正的统一多模态。
  • 强大的指令跟随

    :即使未经过多模板化Prompt Enhance数据训练,也能稳定处理长篇、多约束、层次化的复杂视觉指令。
  • 轻量高效

    :仅以8B-MoT的模型规模,实现可比肩商用闭源模型的生成与编辑效果,降低部署门槛。

原生4K生成:超大画幅下的细节盛宴

U1.5-Lite-Preview实现了原生4K分辨率的生成能力。这不仅仅是像素数量的增加,更是对细节、材质、光影和整体一致性的全面升级。无论是自然风光、商业摄影、产品海报还是超宽幅长卷,模型都能呈现出真实的材质质感与光影层次。

以下案例展示了模型对不同场景的卓越表现力:

  • 海岸游客中心建筑概念图
  • 阳光下的面
  • 主题创意海报,人物摄影与夸张字体融合设计
  • 迷你厨师团队正在装饰一只蓝莓奶油
  • 女生站在路边,身后车辆穿梭而过

特别是,模型能够生成横跨2018至2026年WAIC发展历程的长卷,在超大画幅下依然保持细节与视觉一致性。

文字生成与版式升级:信息量再大,效果也稳得住

U1.5-Lite-Preview强化了中英文文字生成及复杂版式组织能力。从杂志内页、旅行攻略到复杂信息图,模型都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。

  • 信息图
  • 输入图片 / 输出图片(案例:餐饮海报定制)

单参考图条件创作:以一张图为基础,完成完整视觉设计

该模型支持以单张人物、产品或场景图片作为视觉条件。在保持主体身份、外观和关键细节的基础上,模型能够生成全新的海报、信息图、营销页面或其他设计内容。

  • 输出图片(案例:人物照片简历排版)

精准编辑能力:从局部到文字,全方位可控

U1.5-Lite-Preview在图像编辑方面实现了多项突破,提供了精准、可控的编辑体验。

信息图局部编辑:牵一发,不动全身

可针对信息图中的标题、数字、图标、标注、图表及内容模块进行定向修改。支持元素增删、位置调整、局部美化和瑕疵修复,确保编辑范围外的内容不受影响。

  • 输出图片(案例:替换标题文字)

文字编辑:文字改了,风格还在

可对真实场景中的文字进行编辑,并保持原有的字体、材质、透视、排版与遮挡关系,使修改后的文字自然融入原图。

  • 输出图片(案例:添加手绘注释)

交互式精准编辑:画个框,告诉模型“改这里”

支持区域标记、坐标定位、marker标记等方式,让模型更准确地理解编辑位置与范围,可对局部属性进行调整。

  • 输出图片(案例:红框指定区域修改)

技术迭代:从验证架构可行,到真实场景好用

U1成功验证了原生统一多模态架构的可行性,而U1.5-Lite-Preview则针对实际落地中的真实痛点进行了系统性优化:

  • 网格伪影与高分辨率细节

    :U1在生成高分辨率图像时,不同区域有时会衔接不自然,出现细微的网格感或拼接痕迹。U1.5-Lite-Preview通过重新设计生成头,减弱视觉Token网格对最终图像的影响,并将训练扩展至4K分辨率
  • 图像编辑稳定性

    :在实际工作流中,编辑操作有时会导致编辑范围外内容变化、主体身份漂移或局部修改影响整体画面。U1.5-Lite-Preview通过重新组织编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力。

得益于这些改进,U1.5-Lite-Preview在多项主流生成/编辑质量评测基准上取得了显著提升:

  • Qwen-Image-Bench从47.14提升到了55.20(with Prompt Enhance)
  • ImgEdit-Bench从3.90提升到4.37
  • GEdit-Bench-en从7.47提升到8.17
  • GEdit-Bench-zh从7.42提升到8.05

降低使用门槛:实验性Prompt Enhance Skill

为了帮助用户更好地实现复杂视觉指令,U1.5-Lite-Preview还配套了实验性的Prompt Enhance Skill。该工具能够将用户简短的想法,自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案,再交由模型执行。这能有效减少因描述遗漏导致的效果偏差,显著降低创作门槛。

小提示:

即使没有Prompt Enhance,U1.5-Lite-Preview本身也具备强大的指令跟随能力。但建议在使用复杂指令时,充分利用该工具,以获得更精准、更符合预期的结果。

开源与未来展望

SenseNova U1.5-Lite-Preview现面向全球用户开源,欢迎广大开发者与创作者下载体验,提供反馈和建议。

从U1到U1.5,代表着商汤在底层创新上的持续进展。同时,面向专业用户的交付级创作模型U1 Pro正在紧密邀测,并将在近期对公众开放服务,预示着更强大的统一多模态创作能力即将到来。

常见问题:

  • 问:U1.5-Lite-Preview与U1相比,主要提升在哪里?


    答:主要提升在于生成与编辑能力。具体包括:支持原生4K分辨率生成,改善了高分辨率下的细节与一致性;图像编辑能力大幅增强,支持更精准的局部编辑、文字编辑和交互式编辑;在多项评测基准上取得了显著提升。
  • 问:我是否需要写非常复杂的Prompt才能使用这个模型?


    答:不需要。模型本身具备强大的指令跟随能力,可以直接理解自然语言。但为了获得更理想的效果,建议使用配套的“Prompt Enhance Skill”功能,它能自动将简短想法扩充为带有详细约束的创作方案,降低描述遗漏的风险。
  • 问:8B-MoT的模型规模意味着什么?


    答:8B-MoT(8 Billion参数,Mixture of Transformers)意味着模型参数量约为80亿,属于轻量级模型。这使得它在保证强大性能的同时,更容易部署和运行,对硬件资源的要求相对较低,适合更广泛的开发者与创作者使用。