🧠 模型发布 · 开源

轻量级多模态模型正式版开源:8B参数解锁原生4K视觉创作与超长指令

商汤科技发布 SenseNova U1.5 Lite 正式版,以8B 参数量实现3–4k 字符超长指令遵循原生 4K 分辨率输出,在图像编辑、文字布局、多图融合等真实视觉任务中达到工业化交付水准。模型已面向全球开源。

综合公开信息整理 2026-07-22 全文约 4 分钟读完
#SenseNova #多模态 #8B #开源 #视觉生成
8B 参数量 · 单卡可运行
3–4k 上下文长度 · 超长指令
4K 原生分辨率输出
6 核心能力维度

⚡ 30 秒速览

  • 解决了什么:轻量模型长期存在的「指令一长就崩溃、细节一多就遗漏」瓶颈,首次在 8B 级别实现 3–4k 字符复杂指令的稳定执行。
  • 核心突破:原生 4K 输出、像素级图像编辑、多图融合、复杂文字布局——这些以往只有超大规模商业模型具备的能力,现在 8B 模型也能交付。
  • 技术底色:NEO-unify 统一架构 + MOPD 蒸馏技术,将多专家能力无损融合至单体模型,无需 Router 切换,单次推理兼顾理解与生成。
  • 开源范围:模型权重、推理代码、评测流程全量开放,全球开发者可自由部署与二次开发。
  • 体验入口:模型已上架 GitHub 与 Hugging Face,搜索 SenseNova-U1.5-8B-MoT 即可获取。

01六大能力 轻量级模型的「全栈」视觉创作

SenseNova U1.5 Lite 正式版围绕真实视觉交付场景重新设计了训练与后训练流程。它不是「能画图」的模型,而是能稳定完成复杂视觉任务的生产工具。

📝 超长指令遵循 3–4k 字符,多重约束并行
🎨 高质量视觉生成 构图/色彩/光影/材质全面提升
✂️ 原生图像编辑 局部修改,非编辑区域精准保持
🔤 文字与复杂布局 中英文/海报/信息图/品牌视觉
🎯 精细视觉控制 Bounding Box / Visual Marker / 参考图
🖼️ 原生 4K 输出 高分辨率兼顾肌理与微小文字

一个诚实的注脚:这六项能力并非「样样顶尖」,而是在轻量级、单卡可运行的约束下,实现了以往只有数十亿甚至百亿参数模型才能达到的交付水平。每一项都经过任务导向的强化学习专项优化。

六大能力覆盖了从创意构思到成品交付的完整视觉创作链路,全部在 8B 单模型中完成,无需外部工具或模型路由。

02它到底能交付什么?三个真实场景验证

我们挑选了三个最能体现「稳定完成真实视觉交付」的场景。每个场景都对应着创作者日常最头疼的痛点。

📰 复杂海报生成:25 行指令 + 超长布局约束 指令遵循 · 满分

  • 输入:一段超过 500 字的详细 prompt,包含分镜布局、手绘风格、多面板内容、文字样式、颜色、对话框位置等超过 20 项约束。
  • 执行:模型一次性解析全部指令,生成包含 5 个分镜面板、3 种字体风格、2 个对话框、1 个爆炸框的完整漫画风格海报。
  • 关键:所有文字内容准确呈现,无遗漏、无错位;分镜逻辑与原始描述完全一致。
评分:指令遵循 5/5,布局精度 5/5,文字渲染 5/5 —— 复杂约束下的稳定输出。

🖌️ 草图转漫画:保留线稿结构,注入完整视觉风格 编辑保持 · 卓越

  • 输入:一张手绘线稿草图 + 一篇极长的风格与内容描述(包含复古暖色调、米黄纸张质感、烛光氛围、多个分镜面板的文字与颜色要求)。
  • 执行:精准保留原草图的全部构图与分镜轮廓,同时为每个区域独立上色、补充材质与光影。
  • 结果:线稿中每一个面板的位置、大小、人物姿态都与原图一致,但整体呈现为完整的复古漫画风格。
评分:结构保持 5/5,风格迁移 5/5,文字植入 5/5 —— 「改风格不改结构」的教科书级案例。

🐱 多图融合:橘猫骑摩托坐在咖啡馆内 多参考图 · 满分

  • 输入:三张参考图 —— 橘猫、摩托车、咖啡馆室内场景。
  • 执行:模型提取橘猫的主体特征、摩托车的结构、咖啡馆的光影与空间,在全新场景中自然融合。
  • 关键:光影方向一致,比例协调,橘猫与摩托车的交互关系合理,咖啡馆背景的纵深与质感完整保留。
评分:主体融合 5/5,光影一致性 5/5,空间合理性 5/5 —— 多图融合是衡量模型「理解场景」的黄金测试。

三个案例覆盖了「复杂指令」「结构保持」「多图融合」三类核心能力,全部在单次推理中完成,未使用任何外部工具辅助。

038B 的底气 统一架构 + 蒸馏 + 强化学习

8B 参数做到这些,靠的不是堆算力,而是架构设计。传统方案面对不同视觉任务,通常采用显式 Router 将渲染、美学、编辑分发给不同模型,系统开销与推理延迟都很高。

SenseNova U1.5 Lite 的做法完全不同:

传统方案(Router + 多专家)

任务拆分 → 路由分发 → 多模型协同 → 结果合并。系统复杂,延迟高,难以端到端优化。

NEO-unify 统一架构

训练时多专家独立学习,交付时通过 MOPD 蒸馏将多专家能力无损融合至单体 8B 模型,单次推理完成所有任务。

核心在于三个技术支柱:

NEO-unify 统一架构MOPD 多专家蒸馏任务导向 RL 后训练

MOPD 蒸馏让模型在交付阶段无需 Router 切换,一个模型搞定所有视觉任务。任务导向的强化学习则聚焦三个方向:指令遵循(不遗漏约束)、视觉偏好(构图与光影)、编辑保持(像素级局部修改)。三者协同,最终让 8B 模型在文字渲染、复杂布局等任务上达到堪比超大规模商业模型的水平。

一个容易被忽视的细节:理解与生成双向反哺。视觉语义理解形成的空间认知直接反哺生成过程,这让模型能够自然消化多层级指令,在多模态理解榜单上同样保持强劲表现。

MOPD:Multi-Expert Online Policy Distillation,多专家在线策略蒸馏技术,在训练阶段独立训练专家,交付阶段无损融合至单一模型。

04编辑判断

SenseNova U1.5 Lite 正式版的意义,不在于「8B 模型又刷新了某个榜单」,而在于它让轻量级模型第一次具备了进入真实视觉生产流程的条件。

过去两年,开源视觉模型一直在「能看」和「能用」之间徘徊。能生成漂亮的单图,但一旦涉及多轮编辑、精细控制、超长指令,就会暴露出稳定性不足的问题。创作者必须反复调整 prompt,或者用外部工具修补。

U1.5 Lite 的突破在于:它把「稳定性」放在了第一位。训练数据、任务设计、后训练流程全部围绕真实交付场景重新设计,而不是追求单次生成的「惊艳感」。

当然,它也有自己的边界。8B 参数决定了它在极端复杂场景(如包含 50+ 对象的超密集构图)下仍有上限。但在这个参数量级上,它划出了一条新的能力基线。

编辑核心判断

轻量级多模态模型的竞争,正在从「谁画得更好看」转向「谁能在真实生产流程中稳定交付」。SenseNova U1.5 Lite 证明了 8B 参数也能做到——前提是架构设计、训练策略与工程实现三者深度协同,而非简单堆叠数据与算力。

获取模型

SenseNova U1.5 Lite 正式版已面向全球开源,开发者可前往 GitHub 或 Hugging Face 搜索 SenseNova-U1.5-8B-MoT 下载模型权重与推理代码,也支持通过 SenseNova Studio 在线体验。

GitHub · Hugging Face · 魔搭社区 → 搜索 SenseNova-U1.5