10B 参数击败 80B:开源图像模型 Boogu-Image-0.1 登顶基准,真实场景实测
2026 年 6 月,HuggingFace 上一个名为 Boogu-Image-0.1 的开源模型以 10B 参数在 Qwen-Image-Bench 上拿到 53.58 分,超越 20B 的 Qwen-Image-2512 和 80B 的 Hunyuan-Image-3.0。以对手 1/8 的参数量实现反超,但跑分之外的真实场景考验才刚刚开始。
2026 年 6 月,HuggingFace 上一个名为 Boogu-Image-0.1 的开源模型以 10B 参数在 Qwen-Image-Bench 上拿到 53.58 分,超越 20B 的 Qwen-Image-2512 和 80B 的 Hunyuan-Image-3.0。以对手 1/8 的参数量实现反超,但跑分之外的真实场景考验才刚刚开始。
注:柱形自 48 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 1.52 分,与第三名分差 2.77 分。参数规模差距最大达 8 倍。
这个基准与传统图像评测的区别非常直接:
侧重单张画质、风格模仿、美学评分,与真实生产场景的「多轮改稿 + 文字准确 + 局部编辑」存在距离。
考的是「模型在复杂指令下的综合产出能力」——文字渲染、构图逻辑、物理一致性、多轮编辑稳定性,缺一不可。
但基准分数只是入场券。真实生产场景的考验,远比跑分复杂。
Boogu-Image-0.1 此次同步开源了四个版本,分别针对不同的生产环节:
注:四个版本共享 10B 底座,Turbo 通常 3-4 步完成生成,FP8 为原生量化版本,降低显存与推理开销。
我们按照「快速出图→复杂海报→局部编辑」的链路,逐一测试了 Boogu-Image-0.1 在生产级任务中的真实表现。
Boogu-Image-0.1 真正的工程价值,不在单张图能有多惊艳,而在它把图像生成的边际成本向下推了一大截。
FP8 原生量化版本,才是这次开源中最值得关注的信号。
相比 FP16/BF16,FP8 在单个数值位宽上更低,权重存储和部分计算链路开销同步下降。10B 参数 + FP8 精度的组合,意味着企业私有云或本地部署方案的可用性——尤其在 Agent 高频调用场景下,延迟、显存开销、单位部署成本、高并发承载能力会成为新的胜负手。
高质量生成,密集文本渲染,适合复杂海报与排版任务
3-4 步生成,照片级真实感,适合批量素材与快速迭代
双语指令编辑,主体替换与移除,适合改稿工作流
内存与推理成本降低,适合 Agent 高频调用与私有化部署
注:四个版本共享同一底座,FP8 为原生量化而非训练后压缩,在保持输出质量的前提下降低部署门槛。
顶级闭源模型在输出质量上仍有明显优势,但面对 Agent 的高频并发调用时,也会为企业带来难以承受的账单开销。10B 模型的量化部署版本,谈不上替代,但它是需求分层后的一个可靠选择。
Boogu-Image-0.1 的位置其实很清楚:它确实在 Benchmark 上用 10B 击败了 80B,这份以小博大的工程能力值得尊重。但「反超」的含金量,需要放在真实需求里重新评估。
三个绕不开的坎:
文字渲染:图像模型生成文字,本质是在图像空间里生成一组符合文字形态的视觉纹理,不是调用字体文件。中文笔画密度高、结构复杂,小字号文字很容易在压缩-去噪-重建过程中丢失关键笔画。这在 Benchmark 里不会扣分,但在海报标题、产品详情页里,每一个错字都是事故。
编辑不可预期:生成式编辑不是图层修改。模型修改某个区域时,会结合整张图的语义、光影、纹理重新生成局部内容,掩码区域和非掩码区域很难完全隔离。用户只想改标题,模型却可能连带影响周围字体和构图稳定性。每一次局部修复都像投掷概率骰子。
物理逻辑缺失:Base 版本画面中那条「莫名其妙的光带」,暴露了模型对物理世界光源分布缺乏理解。这在单张审美里可能被忽略,但在商业级视觉交付中,一眼就能被识破。
图像模型正在从「参数量的比拼」转向「质量、速度、成本之间的综合平衡」。Boogu-Image-0.1 用一个反超告诉我们:下一阶段谁能在这三者之间找到更好的帕累托前沿,谁才能真正进入 Agent 驱动的生产级工作流。
Boogu-Image-0.1 已开源至主流社区,搜索模型名即可获取全部版本与评测资源。
开源社区搜索 Boogu-Image-0.1