商汤 SenseNova U1.5 Lite 以 80 亿参数在图像理解任务上接近闭源 Image 2 模型水平,开源可本地部署。
上回说到,这个生图模型是 4K 直出的、开源的、只有 8B 大小的。
这一次,它的正式版本来了!若是用三个词来概括,那就是——
例如我们现在一口气把九张不同的食物照片丢给它:

请将这九款美食拼成一张精美的食谱分享卡片。

原本各自拍摄、比例和背景都不一样的九张图片,一下子就被整整齐齐地设计到了一张图里;并且 AI 还精准识别出了每道菜品,同时还给它们适当加了美化处理,让图片整体变得更加养眼。
我们在原图的基础上,用"框选+标注"的方式,把想要修改的图片局部细节给标了出来:


可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,包括整个卧室原来的空间关系都基本保留下来。
而这个 AI,便是商汤科技这次正式开源的 SenseNova U1.5 Lite,其亮点如下:
而且啊,SenseNova U1.5 Lite 依旧保持了 8B 的大小,还能在复杂排版与精准编辑等核心场景上比肩闭源的 GPT-Image-2:

如果说三周前的 SenseNova U1.5 Lite Preview 版本是验证一个统一模型能够把视觉能力扩展到哪里,那么到了今天的正式版本,商汤科技则是进一步验证这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。
第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。

要在一张竖版信息图里,同时塞进 Harvesting、Fermentation、Roasting、Grinding、Tempering 到 Finished Chocolate 六个阶段。每个阶段既有文字解释,也有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素,而且六层内容还得顺着版式一路往下走。
从最终效果来看,SenseNova U1.5 Lite 已经做到了可以组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。
这种能力再落到更日常的内容生产里,就变成了类似做社交媒体封面这类任务。

这类图看上去虽然元素不算多,但难点就在于要做到"封面感"这三个字。标题要立得住,主体要足够抓眼,三只狗的造型、服饰和表情既要各有区分,又不能彼此打架;同时,整张图还得维持住统一的时尚调性,而不是变成几个可爱元素拼在一起。
从最后的结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张能够直接拿来用的封面作品。
接下来,我们再来看下 SenseNova U1.5 Lite 的局部编辑能力。
仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。

乍一眼看过去,两张图片整体的结构和风格几乎是没有变化的,因为我们的要求就是"仿照参考图"。仔细看细节,原来属于教育项目的元素被替换成厨师帽、砧板、菜谱等厨房相关视觉,左侧的信息也跟着变成 Membership Fees、Commercial Rental、Cooking Classes、Market Sales 和 Event Hosting。
在这类任务中,模型得先分辨出一张图里哪些东西属于主题内容,哪些东西属于更底层的设计逻辑,然后保留后者,再让新内容沿着原来的视觉语言长出来。
不过若是参考图从一张变成了多张,那任务难度就会更大了。

Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster's distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.
这次 Prompt 更细节的一点是,第三张参考图只允许参考内容和信息层级,原来的白色卡片背景不能一起搬过来,新歌单需要直接长在海报原来的黑色做旧背景上。
SenseNova U1.5 Lite 给到的结果如下:

从结果来看,Radiohead 五个人进入了原来的乐队区域,人物处理后的质感和整张海报基本接上了;左下方的信息重新压缩,ESSENTIAL LISTENING 则直接融进右侧版面,没有留下一块突兀的白底。
而对于刚才给到的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先把这三件事分开理解,最后才能重新合成到一张图里。
但在真实设计工作里,还有一种需求没有前面这么复杂,却可能出现得更频繁——改几个字。
这次我们在输入原始图片后,Prompt 如下:
请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从"JUNE 15 – JULY 30, 2024 URBAN GALLERY 123 CREATIVE WAY ARTSVILLE, USA"替换为"AUGUST 10 – SEPTEMBER 28, 2024 METRO MUSEUM 456 DESIGN ROAD CREATIVITY CITY, UK",保持原有的白色与粉色字体样式及排版布局不变。

最终,左下角的信息完成替换,画面中心巨大的"RHYTHM OF FORM"、周围高饱和度的几何图形,以及原本的文字层级都留在原来的位置。
在看完效果之后,接下来的一个问题就是,一个 8B 模型是如何做到文字、审美、复杂布局、长指令、局部编辑都过关的?
据了解,SenseNova U1.5 Lite 继续沿用了 NEO-unify 原生统一多模态架构,把视觉理解、图像生成和编辑放在同一套模型里。
也就是说,在真正动像素之前,模型先要理解画面。哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图里到底哪些东西值得保留……这些理解过程,并不会和后面的生成、编辑彻底分家。
而正式版这次比较关键的一处变化,发生在训练阶段。商汤采用了一套很容易理解的办法:先拆开练,再合回来。
文字渲染、美学表达、图像编辑这些目标,先会分别训练对应的专项 Expert。等这些 Expert 练完以后,再通过多教师在线策略蒸馏技术 MOPD,把它们的专项能力重新融合回同一个 SenseNova U1.5 Lite 里。
所以训练时虽然有多个专项老师,到了最后真正交付和部署的时候,用户拿到的依然只有一个 8B 模型。没有额外 Router 在背后判断"这次应该调用哪个子模型",用户也不用在文字、美学、编辑几个模型之间自己来回切。
比如 Radiohead 那组多参考图任务,模型先得理解原海报的视觉骨架,再识别人物,还要从另一张图里提取文字结构,最后才能完成生成。"只改左下角"首先得先理解什么叫"左下角",哪些文字属于目标区域,周围哪些图形、字体和版式不能动。等这些判断做完,才轮到最后的像素生成。
所以在统一训练体系里,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿里把这件事概括为"理解与生成双向反哺"。
而要让这种能力在复杂任务里稳定下来,正式版后训练又专门强化了三件事。
第一件叫指令遵循。 用户写了一大串要求,主体有几个、谁在左边、文字放哪儿、什么颜色、哪些东西不许改,最后模型到底执行了多少。
第二件叫视觉偏好。 指令都完成以后,整张图的构图、材质、光影和最终质感到底过不过关。
第三件是编辑保持。 要改的区域能不能改准,原本已经正确的地方还能不能留下来。
这三项其实刚好对应了前面几个案例最容易出问题的地方:复杂信息图怕漏要求,STYLE 这样的封面直接考验美学完成度,而卧室修改、Radiohead 和文字替换,则都离不开对非编辑区域的保持。
另外还有提示词增强。如果用户只给一句比较简短的需求,PE 可以先帮忙把意图整理成更完整的创作方案,再交给 U1.5 Lite 执行。
以上便是正式版 SenseNova U1.5 Lite 背后的技术关键了。
若是把时间线拉长一些,回头再看 SenseNova U 系列这几次变化,其实我们会发现一个比较明显的趋势。
早期大家看生图模型,最容易比较的是够不够惊艳。但当 AI 的生图能力越发普及,真正决定模型能不能进入工作流的问题,开始出现在第一张图生成以后。
这也是 SenseNova U1.5 Lite 正式版反复强调"稳定"的原因。相比再增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。
对应地,评价模型的标准也在发生变化。一张图够不够漂亮依然重要,但真正拉开差距的,越来越可能是模型能不能从理解需求、生成内容,一路完成修改、细化和最终交付。
SenseNova U1.5 Lite 最终交付出去的依然只有 8B。它没有不断叠加外部路由,也没有把不同任务拆给多个模型分别完成,而是先通过多个专项 Expert 补强能力,再把这些能力重新收进一个统一模型里。这样做的好处很直接:调用链路更短,部署更轻,同时还能尽量保住不同任务之间的一致性。
落到开发者和创作者的实际使用里,最终对应的其实就是三个字,快、好、省。
商汤的判断是,多模态仍然会是 AI 走向物理世界、真正进入生产环节的重要方向。因此这次 U1.5 Lite 正式版继续把大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很抓人,却更直接决定了模型能不能被真正用起来。
如果说三周前的 Preview 版本更多是在验证,一个 8B 统一模型的视觉能力究竟能铺到多宽。
那么到了正式版,问题已经开始变成另一件事:
这些已经铺开的能力,究竟能不能稳定地拿来干活。
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
SenseNova Studio 在线体验:https://unify.light-ai.top/