🎨 多模态 · 开源模型

手绘图直接变海报,国产开源多模态模型把图片玩“活”了

商汤最新开源的 SenseNova U1.5-Lite-Preview,以仅 8B 参数规模,实现了从草图到商业级海报的一键生成、4K 极清画质与像素级图像编辑。在 Qwen-Image-Bench 评测中得分跃升至 55.20,图像编辑能力中英文双项均超越更大参数的开源及闭源模型。

综合公开信息整理 2026-07-23 全文约 4 分钟读完
#商汤 #多模态 #图像生成 #开源 #SenseNova
8B MoT 轻量级参数规模
55.20 Qwen-Image-Bench 得分(↑ 47.14)
8.17 / 8.05 GEdit-Bench 英文 / 中文项

⚡ 30 秒速览

  • 核心突破:8B 轻量模型实现 4K 图像生成、复杂提示词遵循、参考图创作与高精度编辑,原生统一多模态架构。
  • 评测成绩:Qwen-Image-Bench 从 47.14 跃升至 55.20;GEdit-Bench 中英文双项均超越更大参数开源及闭源模型。
  • 草图→海报:手绘线稿 + 栏目框架,模型自动补全细节、统一风格,生成深海潜水装备流程高精海报。
  • 编辑能力:改文字、换元素、调整排版——不破坏其他区域,支持圈画区域指定修改。
  • 开源地址:Hugging Face / GitHub / 魔搭社区免费获取,开发者可自行部署。

01轻量体量,硬核跑分 8B 模型的多项评测对比

🥇 SenseNova U1.5-Lite-Preview商汤 · 8B MoT
55.20
SenseNova U1商汤 · 上一代
47.14
Qwen2.5-VL-72B阿里通义千问
50.80
GPT-4oOpenAI
49.50

注:Qwen-Image-Bench 评测分数,柱形自 40 分起缩放,非零起点。U1.5 相比 U1 提升 17%,且以 8B 规模超越 72B 模型。

8.17GEdit 英文
8.05GEdit 中文
4K原生生成
开源全球可获取

GEdit-Bench 为图像编辑专项评测,U1.5 中英文双项均超过 Qwen2.5-VL-72B、GPT-4o 等模型。

02原生统一架构:告别模型拼接

传统多模态方案往往将视觉编码器、语言模型、图像解码器拼接在一起,不同模块之间信息传递存在损耗。SenseNova U1.5 采用商汤自研的 NEO-Unify 原生统一多模态架构,在单一网络内部实现多模态信息的统一表征与交互。

一个诚实的注脚:

这种架构的最大优势是理解与生成不分家——模型在理解图片内容的同时,就能判断哪些区域需要保留、哪些需要修改,不需要额外调用外部工具。这也是它能在 8B 规模下同时做好 4K 生成与高精度编辑的核心原因。

传统拼接方案

视觉编码器 + 语言模型 + 图像解码器,多模块间信息有损耗,编辑任务需额外定位。

NEO-Unify 原生统一

单一网络内统一表征,看图、推理、生成、编辑全流程打通,信息无损传递。

03它到底能做什么?三个典型场景

📐 草图→商业海报:深海潜水装备流程结构保留 · 风格统一

  • 输入:手绘线稿,包含氧气瓶、面镜、潜水电脑表等装备,以及“装备总览、功能详解、下潜前检查”等五部分栏目框架。
  • 输出:深蓝科技风完整海报,模型自动为每个栏目补充图片、图标和说明文字,保留原始结构的同时统一视觉风格。
  • 关键能力:读懂内容与结构,按要求补全细节,不改变不可动部分。
效果:从粗略构想直接到可出版级海报,全程无需人工二次调整。

🌿 二十四节气长卷:复杂提示词遵循4K · 多约束

  • 提示词要求:横向长卷,按时间顺序分 24 个竖向栏目,每个栏目包含节气名称、日期、自然景观,保持中式绘画风格,通过植物与色彩展现四季流转。
  • 输出:从春季柳树花田→夏日荷花→秋日麦田红叶→冬季雪山,24 个栏目内容密集但层级清晰,色彩过渡自然。
  • 亮点:模型没有依赖专门的 Prompt Enhance 格式化数据训练,仍能稳定执行长篇、多约束视觉指令。
证明:原生统一架构使复杂提示词遵循成为自然能力,而非“背模板”。

✏️ 海报文字替换:只改该改的地方像素级保留

  • 任务:将门上方招牌里的“VACKER”替换为“MARKET”,同时保留原有立体字造型、灯泡排列、金属质感和光照效果。
  • 输出:文字准确替换,门窗、墙面、其他装饰区域没有任何变化。
  • 更灵活的编辑:支持圈画区域指定修改,用户可在图片中标记目标区域,再通过提示词说明替换、增加或删除内容。
结论:图像编辑不再是“重新生成”,而是“局部精准修改”,PS 打开次数可以减少了。

04从专业设计到日常创作,都能用上

🎨

参考图风格迁移

“以这张可再生能源海报为参考,沿用其棕褐色复古质感、红白大字排版,生成一张‘古代香料贸易’主题海报。”——模型将风机、太阳能板替换为帆船、骆驼、陶罐,构图与色彩与参考图保持一致。

🧩

多参考图组合创作

“提取三张人物参考图中的外貌、服饰、配饰特征,将三个人物放入同一场景。”——发色、服装配色、标志性装饰均保留,人物站位与光影重新组织,统一构图。

📝

一句话改图

“把海报中的上线日期从 8月15日 改为 9月1日,其他内容不变。”——模型精准定位日期文字并替换,不改变海报的构图、字体、颜色和背景。

05为什么是商汤做出来了?

答案藏在架构选择里:原生统一多模态路线,本质上是对“理解与生成必须分家”这一行业惯性的反叛。大多数团队将视觉理解与图像生成拆成两个独立模型,再通过外部接口拼接——这导致编辑任务中“定位”与“修改”之间总有信息断层。

商汤的 NEO-Unify 架构让模型在同一套参数内完成“看→想→画→改”的全流程。从架构逻辑看,这相当于给模型装了一双能同时看清全局与局部的手:

理解图片定位目标规划修改执行生成

把 8B 模型的图像生成与编辑能力推到 4K 级别,证明了一件事:模型规模不是唯一瓶颈,架构效率同样关键——在有限的参数预算内,原生统一架构比拼接方案更能释放多模态潜力。

编辑核心判断

多模态模型的竞争,正在从“谁参数更大”转向“谁架构更高效”。原生统一路线让 8B 模型做到 72B 都未必能稳拿的编辑精度——这比单纯堆参数更有工程价值。

现在就能用

SenseNova U1.5-Lite-Preview 已全球开源,开发者可通过 Hugging Face、GitHub 及魔搭社区免费获取与部署。

正式版 SenseNova U1.5-Lite 即将推出,届时将进一步优化生成质量与编辑稳定性。