品玩

科技创新者的每日必读

打开APP
关闭

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

4K 还开源

樊雅婷

发布于 1小时前

以前的 AI 生图,连六根手指、文字乱码、透视错乱这类基本关都过不了,更不用说商用了。

如今模型能力大幅跃升,用户的要求也随之水涨船高。文字渲染、复杂版式、多图参考、局部编辑、原生4K——这些过去需要多个工具协作才能完成的任务,现在正被压缩进同一套模型之中。

但「能力出现」和「能力可用」之间,依然横亘着不小的距离。一张商业海报可能同时包含人物、产品、商标文字、指定数量、前后空间关系、品牌色号以及若干禁改项,任何一个要素被模型遗漏,整张图就要推倒重来。而每一次推倒重来,都意味着新的token消耗。

甲方的无数条修改意见,就这样在反复生成中被放大为高昂的算力成本。

正因如此,当生图模型真正进入创作流程之后,用户的诉求已经非常明确:更快的时间,更好的交付,更低的成本。

8月3日,商汤开源 SenseNova U1.5 Lite Preview,初步展示了原生统一多模态模型在图像生成与编辑上的能力边界。今天,正式版 SenseNova U1.5 Lite 继续向前迈出一步,目标是让这些能力真正融入视觉创作与交付流程。

这一次升级,商汤没有继续在模型规模上做文章。

由 SenseNova U1.5 Lite生成的图书封面
由 SenseNova U1.5 Lite生成的图书封面

通过精调训练数据、重调后训练流程、优化任务设计,最终打磨出的 SenseNova U1.5 Lite,是一款轻量级、原生统一多模态开源模型。它的目标也非常具体,就是解决用户最真实的诉求,做到更稳、更准、更好。

先把分数摆上来

开源生图从来不缺尝试者。难的是在保持模型开放、轻量和可部署的同时,把画质、文字、布局与编辑放进同一个模型,而且每一项都不能成为明显短板。

SenseNova U1.5 Lite 与主流开源、闭源图片模型横向Benchmark
SenseNova U1.5 Lite 与主流开源、闭源图片模型横向Benchmark

在完整横向评测中,SenseNova U1.5 Lite 在所有维度都位于开源生图模型的领先位置,并且展现了比较均衡的系统能力,在复杂指令、视觉质量和创意生成等维度都表现出较强竞争力。

正式版的提升没有集中在某一项孤立技能上。生成质量、指令执行和编辑能力都在进步。

U1.5 Lite 还能在确保更高性能同时,实现更少的生成延迟。下图显示了测评中,SenseNova U1.5 Lite在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 与 Qwen-Image-Bench 上的生成延迟与平均性能对比

对于需要批量生成海报、电商图和营销素材的团队,这样带来的意义就很直接。同样的时间和预算,可以支持更多次尝试,也能把生成能力放进更高频的工作流。

不过,Benchmark 终究是一张坐标图。

把这些分数塞进一份真实的设计需求,事情才开始变得有意思。

一些实测

一条长Prompt,能不能变成一张完整海报

以前的 AI 生图,提示词太长,模型执行指令时候就会变成金鱼,出现遗忘现象。

所以,第一个测试,是一条长得有些不讲道理的Prompt。

一张竖版2:3复古城市旅行海报,香港维多利亚港,前景是木质红帆船,深红棕色帆面张开,海面有波纹和倒影;中景是现代香港天际线,密集高层建筑,右侧有一栋高耸圆角玻璃摩天楼,左中有带斜向交叉结构的尖顶高楼,建筑背后有灰绿色山体轮廓;远景天空为米白色,右上角有淡橙色柔和小太阳,天空中有几只飞鸟剪影。左上角是巨大的黑色窄长衬线英文标题“HONG KONG”,分两行排列,非常醒目;标题下方有红棕色小号英文副标题“HONG KONG”和几行小字说明。右上角有竖排中文“香港”,红棕色细长宋体,下方有小英文和红色印章式装饰。整体为复古高端旅行海报风格,摄影底图与平面排版结合,低饱和暖色调,米色纸张质感,轻微胶片颗粒,柔和雾气和空气透视,构图左重右轻,留白充足,画面安静怀旧,像高端城市旅游杂志封面。不要出现水印、二维码、品牌标志、乱码文字,不要现代游艇或快艇,不要高饱和蓝天或强烈夕阳,文字清晰准确。

可以看到效果不错,从真的理解到真的执行。

4K不只是把画布放大

高分辨率生成最容易被误解成像素数量的简单增加。

真正困难的,是画布变大之后,模型还能不能稳住整张图的全局结构。标题、正文、图标和人物之间的关系不能散,局部的文字边缘、材质纹理和光影过渡也不能糊成一片。

U1.5 Lite 正式版原生支持 2K 和 4K 生成。在广告级的画幅下,细节经不经得起推敲,一张图说了不算,放大到 100% 才算。

所以我决定拿时尚封面杂志来试。

前卫高定时装摄影。一位模特身着半透明纸质高定服装,由褶皱、折叠插片、层叠纸板构成。构图上方密集、下方留白,地面有一处红色折纸点缀。配色为绿玉色阴影、阳光黄透光纸边、中国红插片、纯白表面。关键词是摄影,前卫高定时尚大片,纸艺工程,风动感,实验冷静气质。

可以看见成片保留要求的同时保留了纸张褶皱、皮肤纹理的真实感。

改一个地方,其他地方不动

第三组测试从一张已经完成的海报开始。

我给的提示词是

把图片中标题的文字样式改为带有噪点和撕纸纹理的复古风格。

再来一个更细节的。我给的 prompt 是

保持这个配色,将左侧红框中的图案换成更真实的3d金属设备 红框仅用于定位,输出图像中不要保留红框。其他地方不变。

可以看到,这两次海报的局部编辑,除了我的要求,其他地方什么都没改变。

算是高质量的修改交付。

这也对应U1.5 Lite正式版后训练中的一个重要目标:Editing Preservation。

好的编辑需要同时完成两个动作。一边准确执行修改,一边保护原图。该动的地方要动,不该动的地方尽量别动。

当这种保持能力逐渐稳定,图片模型才能从一次性生成器变成可反复沟通的创作工具。用户不再需要每次都推倒重来,可以在同一张作品上继续修改。

下面我们尝试下保持参考图的风格和布局,进行编辑:

参考这张图的水墨视觉语言,生成一张候鸟迁徙廊道保护信息图。
参考图
参考图
成图
成图

接下来,我计划再给模型多看几张图,难度还会继续增加。

多张参考图融合出成片

多图参考真正难的地方,是模型能不能分清每张图的职责。

可能它需要保留第一张图里的人物身份,借用第二张图的色彩和材质,再沿用第三张图的版式关系。参考图之间不能互相污染,风格迁移也不能吞掉主体。

U1.5 Lite支持单图、多图参考,以及 Bounding Box、Visual Marker 等控制方式。用户可以指定对象和区域,完成元素插入、替换、局部精修和参考风格迁移。

我把我喜欢的动漫角色都放进一张海报里。

上传这五张图片之后,我给的 prompt 是:

帮我为学校咖啡厅活动设计一张可爱的动漫海报,我想让绿发女孩当我们的厨师,酷男孩(图3)当服务员,黑发女孩(图4)当接待员。让那位严肃的男士(图1)当美食评论家,甜美金发女孩当开心的顾客。请添加一些简单的英文标题,比如“Sweet Cafe”,让它看起来像真正的活动传单。

可以看到最后的成图信息清晰,符合要求。时间 / 地点 / 菜单三个部分以小卡片的形式独立列出,还设计了 So yummy、Come & Enjoy 等符合人物形象的小对白,用气泡呈现增加了活泼感。

模仿、借鉴,再创作

当你的灵感来自于他人的作品,这个时候就可以让模型参考之后进行再创作。就像我觉得下面这张图很好看,我想自己模仿这张图设计一张其他主题的海报。所以我就

更新图1中的主客厅插图,使其与图2中的蓝绿色沙发和几何配色方案相匹配。将现有的白色和橙色沙发替换为蓝绿色L型转角沙发,并更新地毯、扶手椅和墙面装饰,使其采用包含蓝绿色、芥末黄、陶土红、米色和深蓝色的几何图案。添加图3中那只戴着蓝绿色项圈的浅棕色卷毛贵宾犬,让它坐在房间中央扶手椅之间的几何图案地毯上。更新家具布局示意图和配色方案部分,以体现这一新的蓝绿色和几何配色主题。

最后的效果呈现,实力无需多言。

图一
图一
图二
图二
图三
图三
成图
成图

当模型能够区分参考谁的主体、借用谁的风格、沿用谁的布局,多图参考才真正离开玩法展示,进入创作流程。

一个模型,怎样同时做好几件事

SenseNova U1.5 Lite 延续了 NEO-unify 的原生统一多模态路线。

在同一个模型架构之下,视觉理解、图像生成与图像编辑被共同训练。模型首先理解原始图像和用户指令,识别其中的主体、文字与空间关系,再完成像素级的最终生成。整个过程中,用户无需在理解模型、生成模型和编辑工具之间反复切换。

统一带来的价值,还进一步体现在能力的迁移上。

模型在视觉理解任务中习得了结构、位置、文字排布与信息层级,这些认知成果可以顺滑地迁移到生成和编辑任务中。面对一条较长的自然语言指令,模型需要解析的已经不是孤立的关键词,而是这些要求之间的内在关系:谁在左边,谁不能被遮挡,哪段文字属于哪个区域,修改时又有哪些内容必须被保留。这正是 U1.5 Lite 能够处理层级化视觉需求,却不需要依赖固定 JSON 模板的原因之一。

但统一训练解决了能力共享的问题之后,新的矛盾也随之浮现。

OCR 关心文字是否准确可读,美学关心构图、色彩和整体质感,编辑则还要兼顾主体身份与结构保持。如果简单地把所有训练目标混在一起,往往会出现一项能力变强、另一项反而被削弱的窘境。

正式版的应对策略,是让各项专项能力先分别变强。

商汤训练了 OCR、美学和编辑等多个 Expert:OCR Expert 强化中英文文字识别与排版质量,美学 Expert 改善构图、色彩、材质、光影和真实感,编辑 Expert 则负责确保主体身份、空间结构以及非编辑区域的一致保持。随后,通过 MOPD 将这些 Expert 的能力重新蒸馏回 U1.5 Lite 中。

最终部署的,仍然只有一个模型——没有额外的 Router,用户也无需关心该调用哪一个 Expert,生成和编辑继续通过统一接口完成。

在此基础上,正式版又引入了更精细的任务导向 RL。它优化的三个目标,都能与前面的测试维度一一对应:Instruction Compliance 关注复杂指令是否被执行完整,Visual Preference 关注构图、真实感和整体完成度,Editing Preservation 关注指定区域是否改对、其他区域能否保持不变。

最后交付的,仍然是 U1.5 Lite,一个轻量级、易部署的统一模型。

多模态是一件慢回报的事

把镜头拉远,多模态模型正在进入一个更现实的阶段。

能力仍在增长,行业却已经开始算账。投入多少,成本几何,回报又在哪。参数规模能快速制造话题,但真实视觉任务里的稳定性,靠的是数据、评测和一次次后训练,慢慢磨出来。

长指令会不会漏、文字能不能写对、4K下结构能否保持、局部编辑会不会破坏整张图,这些看似微小的问题恰恰决定了模型能不能真正进入海报、信息图、电商素材和品牌视觉的日常生产。

商汤选择继续沿着原生统一的路线投入。

从 U1 到 U1.5 Preview,再到正式版,SenseNova 没有简单叠加一份更长的能力清单。它在尝试回答一个更实际的问题:一个轻量级、统一、开源的多模态模型,能不能更完整地承担真实视觉创作任务?

U1.5 Lite 给出的答案是让能力更强,也让能力更稳。

把视野再拉开一点,视觉创作只是多模态进入现实世界的一站。一个模型需要先理解画面中的对象、文字和空间关系,才能进一步生成、编辑,最终与更复杂的真实环境发生连接。

这条路不会很快。

但对今天的用户来说,判断它有没有向前走并不难。只需要把它放在最真实的需求里,一试便知。

会生成只是起点,稳定地完成任务,才是开源视觉模型真正进入生产的开始。

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:https://unify.light-ai.top/

樊雅婷

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测