🔮 模型 · 开源发布

原生统一多模态模型 U1.5-Lite-Preview 开源:8B 轻量规模拿下 4K 生成与稳定编辑

4 月,SenseNova U1 验证了一条技术路线:语言、视觉语义与像素生成可以在单一模型中联合建模。如今商汤正式开源 U1.5-Lite-Preview——仅以 8B-MoT 的轻量级规模,将统一架构的能力推进至 4K 原生生成、更真实的质感与可持续迭代的编辑。

综合公开信息整理 2026-07 全文约 6 分钟读完
#商汤科技 #SenseNova #多模态 #开源 #4K图像生成 #图像编辑
8B-MoT 轻量级规模,单一模型贯通视觉理解 · 推理 · 生成 · 编辑
4K 原生图像生成分辨率,超越常规 1K / 2K 能力上限
55.20 Qwen-Image-Bench 得分,较 U1 提升 8.06

⚡ TLDR 30 秒速览

  • 开源了什么:SenseNova U1.5-Lite-Preview 预览版,GitHub / Hugging Face / 魔搭社区三平台同步开放。
  • 核心提升:原生 4K 图像生成、更精细的真实质感、更准确的中英文文字与复杂版式、更稳定的图像编辑。
  • 评测表现:Qwen-Image-Bench 47.14→55.20,GEdit-Bench-zh 7.42→8.05,编辑类基准全面上涨。
  • 关键架构:encoder-free 视觉建模减少信息压缩与表征瓶颈;重构生成头减弱网络伪影。
  • 编辑体验进化:从"一次抽卡、不行重来",到"反复修改、改到满意"的可持续创作。

01从"验证路线"到"证明可扩展" · U1 回答了可行性,U1.5 回答能走多远

U1 做了一件此前很少有人做成的事:不拼接多个专家模型,让语言、视觉语义与像素生成在同一个模型中联合建模。它证明了原生统一多模态不是概念,而是一条可执行的路线。

但"可行"只是起点。真正的考验是——这条路线,能走多远?

SenseNova U1(4 月发布)

验证统一架构可行性;理解、推理与生成的基础贯通;分辨率与精细度存在明显上限。

U1.5-Lite-Preview(本次开源)

验证能力可持续扩展;4K 原生生成 + 真实质感 + 复杂版式;编辑成为原生能力,可迭代修改。

四个方向的能力提升,勾勒出这次迭代的完整轮廓:

🖼️ 4K 原生生成 ✨ 精细局部纹理 🔤 中英文文字与版式 🎯 稳定视觉指令遵循

02轻量级模型的"重量级"得分 · 8B 规模,多项基准显著超越 U1

生成与编辑是最难"作弊"的能力——它们要求模型同时具备理解力执行力。U1.5-Lite-Preview 在四项主流基准上拿下全面增长:

Qwen-Image-Bench生成

55.20
U1 47.14 · +8.06

ImgEdit-Bench编辑

4.37
U1 3.90 · +0.47

GEdit-Bench-en编辑·英

8.17
U1 7.47 · +0.70

GEdit-Bench-zh编辑·中

8.05
U1 7.42 · +0.63

注:条形长度为各基准满分比例(非零起点),U1 至 U1.5-Lite-Preview 为同口径官方评分对比,增幅以文字标注为准。

更值得注意的是起点——8B-MoT 的轻量规模,意味着这些分数不是靠参数堆出来的。

03三个场景,看懂"统一"的意义 · 从超长指令到 4K 长卷再到可控编辑

📊 1675 词超长指令,一次生成完整信息图强指令遵循

  • 复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注——多类约束同时生效
  • 没有高度依赖专门的 Prompt Enhance 格式化数据训练,模型依然稳定执行长篇、多约束、层次化指令。
  • 结论:强 prompt following 来自语言到视觉结构的原生映射能力,而非模板记忆。
关键观察:"模型学到的不是某种 prompt 格式本身,而是从语言描述到视觉结构的原生映射。"

🖼️ 3880 词 prompt 的 4K 长卷:2018-2026 十年 AI 图景4K · 10:3

  • 以传统中国山水长卷的散点透视与连续叙事,将上海城市、智慧交通、云计算、智能工厂、大模型、具身机器人、智能体与未来城市融于同一幅山河。
  • 10:3 超宽比例、4K 分辨率,prompt 总长 3880 词。
  • 即使放大观看,大量文字、图标等设计细节依然清晰稳定
关键观察:"4K 不只是像素更多,更是对细节、材质、光影与整体一致性的更高要求。"

✏️ 图像编辑:从"重新采样"到"可持续修改"原生编辑能力

  • 多参考图组合:从多张图中分别提取人物、产品、场景与风格,完成跨图绑定、内容融合与场景重构
  • 真实场景文字编辑:保持原有字体、材质、透视与遮挡关系,使文字自然融入原图。
  • 支持区域标记、坐标定位、marker 标记,让模型更准确理解编辑位置与范围
关键观察:编辑不是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。

04一套架构,打通"看懂"与"修改" · 技术路径的选择

图像编辑的难点在于:模型必须既"看懂"画面,又"想清楚"怎么改,最后还要"画出来"。U1.5 不拼接多个独立模型,而是让视觉理解与像素生成在同一套表征里协作——

视觉理解 目标定位 约束推理 像素生成

支撑这种能力的,是几项关键的技术选择:

encoder-free 视觉建模 不依赖固定视觉编码器,减少信息压缩与表征瓶颈,文字笔画、局部纹理、空间结构保留更完整。
生成头重构 + 4K 训练扩展 重新设计生成头,减弱视觉 Token 网格对最终图像的影响,训练扩展至 4K 分辨率。
编辑数据与训练任务重组 强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力。
Prompt Enhance Skill(实验性) 把简短想法自动整理成包含主体、布局、风格、文字与约束的完整创作方案,降低指令编写门槛。

05一个诚实的注脚 · U1 的痛点与 U1.5 的对策

社区反馈里,U1 的真实场景痛点很清楚。U1.5 的优化也就围绕这些痛点展开——不回避,是这份开源最可贵的地方。

⚠️ U1 被反馈的痛点

  • 生成:不同区域之间衔接不自然,出现细微网格感、拼接痕迹或纹理断裂
  • 生成:分辨率提升后,局部细节、复杂空间关系与整体一致性建模难度加大
  • 编辑:编辑范围外内容发生变化,人物身份或主体结构漂移
  • 编辑:局部修改影响整体画面,需要反复重试

✅ U1.5 的针对性对策

  • 重构生成头:减弱视觉 Token 网格对最终图像的影响
  • 训练扩展至 4K 分辨率,直接建模高分辨率细节
  • 重组编辑数据与训练任务:强化原图内容与主体身份保持
  • 在完成目标修改的同时,尽可能保留原图中不需要改变的部分

换句话说:U1.5 不是换了一个更大的模型,而是把每个环节的工程细节重新打磨了一遍。

编辑核心判断

统一架构的价值,不在于"一个模型做所有事"——而在于理解与生成共享同一套视觉认知。当模型真正"看懂"画面,编辑就不再是重绘,而是修改。

U1.5 用 8B 规模逼近闭源商用效果,说明多模态竞争的重心正在从参数规模转向原生架构与工程细节——这个信号,比分数本身更有分量。

现在就能上手

SenseNova U1.5-Lite-Preview 已在 GitHub、Hugging Face 与魔搭社区三平台同步开源,下载即用。
面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,即将对公众开放服务。

GitHub · Hugging Face · 魔搭社区 三平台开源 →

搜索"SenseNova U1.5"即可找到官方仓库与模型权重,欢迎下载体验并提供反馈。