轻量级多模态模型正式版开源:8B参数解锁原生4K视觉创作与超长指令
商汤科技发布 SenseNova U1.5 Lite 正式版,以8B 参数量实现3–4k 字符超长指令遵循与原生 4K 分辨率输出,在图像编辑、文字布局、多图融合等真实视觉任务中达到工业化交付水准。模型已面向全球开源。
商汤科技发布 SenseNova U1.5 Lite 正式版,以8B 参数量实现3–4k 字符超长指令遵循与原生 4K 分辨率输出,在图像编辑、文字布局、多图融合等真实视觉任务中达到工业化交付水准。模型已面向全球开源。
SenseNova U1.5 Lite 正式版围绕真实视觉交付场景重新设计了训练与后训练流程。它不是「能画图」的模型,而是能稳定完成复杂视觉任务的生产工具。
一个诚实的注脚:这六项能力并非「样样顶尖」,而是在轻量级、单卡可运行的约束下,实现了以往只有数十亿甚至百亿参数模型才能达到的交付水平。每一项都经过任务导向的强化学习专项优化。
六大能力覆盖了从创意构思到成品交付的完整视觉创作链路,全部在 8B 单模型中完成,无需外部工具或模型路由。
我们挑选了三个最能体现「稳定完成真实视觉交付」的场景。每个场景都对应着创作者日常最头疼的痛点。
三个案例覆盖了「复杂指令」「结构保持」「多图融合」三类核心能力,全部在单次推理中完成,未使用任何外部工具辅助。
8B 参数做到这些,靠的不是堆算力,而是架构设计。传统方案面对不同视觉任务,通常采用显式 Router 将渲染、美学、编辑分发给不同模型,系统开销与推理延迟都很高。
SenseNova U1.5 Lite 的做法完全不同:
任务拆分 → 路由分发 → 多模型协同 → 结果合并。系统复杂,延迟高,难以端到端优化。
训练时多专家独立学习,交付时通过 MOPD 蒸馏将多专家能力无损融合至单体 8B 模型,单次推理完成所有任务。
核心在于三个技术支柱:
MOPD 蒸馏让模型在交付阶段无需 Router 切换,一个模型搞定所有视觉任务。任务导向的强化学习则聚焦三个方向:指令遵循(不遗漏约束)、视觉偏好(构图与光影)、编辑保持(像素级局部修改)。三者协同,最终让 8B 模型在文字渲染、复杂布局等任务上达到堪比超大规模商业模型的水平。
一个容易被忽视的细节:理解与生成双向反哺。视觉语义理解形成的空间认知直接反哺生成过程,这让模型能够自然消化多层级指令,在多模态理解榜单上同样保持强劲表现。
MOPD:Multi-Expert Online Policy Distillation,多专家在线策略蒸馏技术,在训练阶段独立训练专家,交付阶段无损融合至单一模型。
SenseNova U1.5 Lite 正式版的意义,不在于「8B 模型又刷新了某个榜单」,而在于它让轻量级模型第一次具备了进入真实视觉生产流程的条件。
过去两年,开源视觉模型一直在「能看」和「能用」之间徘徊。能生成漂亮的单图,但一旦涉及多轮编辑、精细控制、超长指令,就会暴露出稳定性不足的问题。创作者必须反复调整 prompt,或者用外部工具修补。
U1.5 Lite 的突破在于:它把「稳定性」放在了第一位。训练数据、任务设计、后训练流程全部围绕真实交付场景重新设计,而不是追求单次生成的「惊艳感」。
当然,它也有自己的边界。8B 参数决定了它在极端复杂场景(如包含 50+ 对象的超密集构图)下仍有上限。但在这个参数量级上,它划出了一条新的能力基线。
轻量级多模态模型的竞争,正在从「谁画得更好看」转向「谁能在真实生产流程中稳定交付」。SenseNova U1.5 Lite 证明了 8B 参数也能做到——前提是架构设计、训练策略与工程实现三者深度协同,而非简单堆叠数据与算力。
SenseNova U1.5 Lite 正式版已面向全球开源,开发者可前往 GitHub 或 Hugging Face 搜索 SenseNova-U1.5-8B-MoT 下载模型权重与推理代码,也支持通过 SenseNova Studio 在线体验。
GitHub · Hugging Face · 魔搭社区 → 搜索 SenseNova-U1.5