🔮 模型 · 开源发布
原生统一多模态模型 U1.5-Lite-Preview 开源:8B 轻量规模拿下 4K 生成与稳定编辑
4 月,SenseNova U1 验证了一条技术路线:语言、视觉语义与像素生成可以在单一模型中联合建模。如今商汤正式开源 U1.5-Lite-Preview——仅以 8B-MoT 的轻量级规模,将统一架构的能力推进至 4K 原生生成、更真实的质感与可持续迭代的编辑。
综合公开信息整理•
2026-07•
全文约 6 分钟读完
#商汤科技
#SenseNova
#多模态
#开源
#4K图像生成
#图像编辑
8B-MoT
轻量级规模,单一模型贯通视觉理解 · 推理 · 生成 · 编辑
4K
原生图像生成分辨率,超越常规 1K / 2K 能力上限
55.20
Qwen-Image-Bench 得分,较 U1 提升 8.06
⚡ TLDR 30 秒速览
- 开源了什么:SenseNova U1.5-Lite-Preview 预览版,GitHub / Hugging Face / 魔搭社区三平台同步开放。
- 核心提升:原生 4K 图像生成、更精细的真实质感、更准确的中英文文字与复杂版式、更稳定的图像编辑。
- 评测表现:Qwen-Image-Bench 47.14→55.20,GEdit-Bench-zh 7.42→8.05,编辑类基准全面上涨。
- 关键架构:encoder-free 视觉建模减少信息压缩与表征瓶颈;重构生成头减弱网络伪影。
- 编辑体验进化:从"一次抽卡、不行重来",到"反复修改、改到满意"的可持续创作。
01从"验证路线"到"证明可扩展" · U1 回答了可行性,U1.5 回答能走多远
U1 做了一件此前很少有人做成的事:不拼接多个专家模型,让语言、视觉语义与像素生成在同一个模型中联合建模。它证明了原生统一多模态不是概念,而是一条可执行的路线。
但"可行"只是起点。真正的考验是——这条路线,能走多远?
SenseNova U1(4 月发布)
验证统一架构可行性;理解、推理与生成的基础贯通;分辨率与精细度存在明显上限。
U1.5-Lite-Preview(本次开源)
验证能力可持续扩展;4K 原生生成 + 真实质感 + 复杂版式;编辑成为原生能力,可迭代修改。
四个方向的能力提升,勾勒出这次迭代的完整轮廓:
🖼️ 4K 原生生成
✨ 精细局部纹理
🔤 中英文文字与版式
🎯 稳定视觉指令遵循
02轻量级模型的"重量级"得分 · 8B 规模,多项基准显著超越 U1
生成与编辑是最难"作弊"的能力——它们要求模型同时具备理解力与执行力。U1.5-Lite-Preview 在四项主流基准上拿下全面增长:
Qwen-Image-Bench生成
55.20
U1 47.14 · +8.06
ImgEdit-Bench编辑
4.37
U1 3.90 · +0.47
GEdit-Bench-en编辑·英
8.17
U1 7.47 · +0.70
GEdit-Bench-zh编辑·中
8.05
U1 7.42 · +0.63
注:条形长度为各基准满分比例(非零起点),U1 至 U1.5-Lite-Preview 为同口径官方评分对比,增幅以文字标注为准。
更值得注意的是起点——8B-MoT 的轻量规模,意味着这些分数不是靠参数堆出来的。
03三个场景,看懂"统一"的意义 · 从超长指令到 4K 长卷再到可控编辑
📊 1675 词超长指令,一次生成完整信息图强指令遵循
- 复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注——多类约束同时生效。
- 没有高度依赖专门的 Prompt Enhance 格式化数据训练,模型依然稳定执行长篇、多约束、层次化指令。
- 结论:强 prompt following 来自语言到视觉结构的原生映射能力,而非模板记忆。
关键观察:"模型学到的不是某种 prompt 格式本身,而是从语言描述到视觉结构的原生映射。"
🖼️ 3880 词 prompt 的 4K 长卷:2018-2026 十年 AI 图景4K · 10:3
- 以传统中国山水长卷的散点透视与连续叙事,将上海城市、智慧交通、云计算、智能工厂、大模型、具身机器人、智能体与未来城市融于同一幅山河。
- 10:3 超宽比例、4K 分辨率,prompt 总长 3880 词。
- 即使放大观看,大量文字、图标等设计细节依然清晰稳定。
关键观察:"4K 不只是像素更多,更是对细节、材质、光影与整体一致性的更高要求。"
✏️ 图像编辑:从"重新采样"到"可持续修改"原生编辑能力
- 多参考图组合:从多张图中分别提取人物、产品、场景与风格,完成跨图绑定、内容融合与场景重构。
- 真实场景文字编辑:保持原有字体、材质、透视与遮挡关系,使文字自然融入原图。
- 支持区域标记、坐标定位、marker 标记,让模型更准确理解编辑位置与范围。
关键观察:编辑不是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。
04一套架构,打通"看懂"与"修改" · 技术路径的选择
图像编辑的难点在于:模型必须既"看懂"画面,又"想清楚"怎么改,最后还要"画出来"。U1.5 不拼接多个独立模型,而是让视觉理解与像素生成在同一套表征里协作——
视觉理解→
目标定位→
约束推理→
像素生成
支撑这种能力的,是几项关键的技术选择:
encoder-free 视觉建模
不依赖固定视觉编码器,减少信息压缩与表征瓶颈,文字笔画、局部纹理、空间结构保留更完整。
生成头重构 + 4K 训练扩展
重新设计生成头,减弱视觉 Token 网格对最终图像的影响,训练扩展至 4K 分辨率。
编辑数据与训练任务重组
强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力。
Prompt Enhance Skill(实验性)
把简短想法自动整理成包含主体、布局、风格、文字与约束的完整创作方案,降低指令编写门槛。
05一个诚实的注脚 · U1 的痛点与 U1.5 的对策
社区反馈里,U1 的真实场景痛点很清楚。U1.5 的优化也就围绕这些痛点展开——不回避,是这份开源最可贵的地方。
⚠️ U1 被反馈的痛点
- 生成:不同区域之间衔接不自然,出现细微网格感、拼接痕迹或纹理断裂
- 生成:分辨率提升后,局部细节、复杂空间关系与整体一致性建模难度加大
- 编辑:编辑范围外内容发生变化,人物身份或主体结构漂移
- 编辑:局部修改影响整体画面,需要反复重试
✅ U1.5 的针对性对策
- 重构生成头:减弱视觉 Token 网格对最终图像的影响
- 训练扩展至 4K 分辨率,直接建模高分辨率细节
- 重组编辑数据与训练任务:强化原图内容与主体身份保持
- 在完成目标修改的同时,尽可能保留原图中不需要改变的部分
换句话说:U1.5 不是换了一个更大的模型,而是把每个环节的工程细节重新打磨了一遍。
编辑核心判断
统一架构的价值,不在于"一个模型做所有事"——而在于理解与生成共享同一套视觉认知。当模型真正"看懂"画面,编辑就不再是重绘,而是修改。
U1.5 用 8B 规模逼近闭源商用效果,说明多模态竞争的重心正在从参数规模转向原生架构与工程细节——这个信号,比分数本身更有分量。
▶现在就能上手
SenseNova U1.5-Lite-Preview 已在 GitHub、Hugging Face 与魔搭社区三平台同步开源,下载即用。
面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,即将对公众开放服务。
GitHub · Hugging Face · 魔搭社区 三平台开源 →
搜索"SenseNova U1.5"即可找到官方仓库与模型权重,欢迎下载体验并提供反馈。