手绘图直接变海报,国产开源多模态模型把图片玩“活”了
商汤最新开源的 SenseNova U1.5-Lite-Preview,以仅 8B 参数规模,实现了从草图到商业级海报的一键生成、4K 极清画质与像素级图像编辑。在 Qwen-Image-Bench 评测中得分跃升至 55.20,图像编辑能力中英文双项均超越更大参数的开源及闭源模型。
商汤最新开源的 SenseNova U1.5-Lite-Preview,以仅 8B 参数规模,实现了从草图到商业级海报的一键生成、4K 极清画质与像素级图像编辑。在 Qwen-Image-Bench 评测中得分跃升至 55.20,图像编辑能力中英文双项均超越更大参数的开源及闭源模型。
注:Qwen-Image-Bench 评测分数,柱形自 40 分起缩放,非零起点。U1.5 相比 U1 提升 17%,且以 8B 规模超越 72B 模型。
GEdit-Bench 为图像编辑专项评测,U1.5 中英文双项均超过 Qwen2.5-VL-72B、GPT-4o 等模型。
传统多模态方案往往将视觉编码器、语言模型、图像解码器拼接在一起,不同模块之间信息传递存在损耗。SenseNova U1.5 采用商汤自研的 NEO-Unify 原生统一多模态架构,在单一网络内部实现多模态信息的统一表征与交互。
一个诚实的注脚:
这种架构的最大优势是理解与生成不分家——模型在理解图片内容的同时,就能判断哪些区域需要保留、哪些需要修改,不需要额外调用外部工具。这也是它能在 8B 规模下同时做好 4K 生成与高精度编辑的核心原因。
视觉编码器 + 语言模型 + 图像解码器,多模块间信息有损耗,编辑任务需额外定位。
单一网络内统一表征,看图、推理、生成、编辑全流程打通,信息无损传递。
“以这张可再生能源海报为参考,沿用其棕褐色复古质感、红白大字排版,生成一张‘古代香料贸易’主题海报。”——模型将风机、太阳能板替换为帆船、骆驼、陶罐,构图与色彩与参考图保持一致。
“提取三张人物参考图中的外貌、服饰、配饰特征,将三个人物放入同一场景。”——发色、服装配色、标志性装饰均保留,人物站位与光影重新组织,统一构图。
“把海报中的上线日期从 8月15日 改为 9月1日,其他内容不变。”——模型精准定位日期文字并替换,不改变海报的构图、字体、颜色和背景。
答案藏在架构选择里:原生统一多模态路线,本质上是对“理解与生成必须分家”这一行业惯性的反叛。大多数团队将视觉理解与图像生成拆成两个独立模型,再通过外部接口拼接——这导致编辑任务中“定位”与“修改”之间总有信息断层。
商汤的 NEO-Unify 架构让模型在同一套参数内完成“看→想→画→改”的全流程。从架构逻辑看,这相当于给模型装了一双能同时看清全局与局部的手:
把 8B 模型的图像生成与编辑能力推到 4K 级别,证明了一件事:模型规模不是唯一瓶颈,架构效率同样关键——在有限的参数预算内,原生统一架构比拼接方案更能释放多模态潜力。
多模态模型的竞争,正在从“谁参数更大”转向“谁架构更高效”。原生统一路线让 8B 模型做到 72B 都未必能稳拿的编辑精度——这比单纯堆参数更有工程价值。
SenseNova U1.5-Lite-Preview 已全球开源,开发者可通过 Hugging Face、GitHub 及魔搭社区免费获取与部署。
正式版 SenseNova U1.5-Lite 即将推出,届时将进一步优化生成质量与编辑稳定性。