1/8参数跑赢80B大模型,Boogu-Image-0.1登顶图像生成基准
2026年6月,HuggingFace上一个名为Boogu-Image-0.1的开源模型引爆AI圈——仅10B参数,在Qwen-Image-Bench基准测试中以53.58分领先20B的Qwen-Image-2512(52.06)和80B的Hunyuan-Image-3.0(50.81),以对手1/8的参数规模实现性能反超。
2026年6月,HuggingFace上一个名为Boogu-Image-0.1的开源模型引爆AI圈——仅10B参数,在Qwen-Image-Bench基准测试中以53.58分领先20B的Qwen-Image-2512(52.06)和80B的Hunyuan-Image-3.0(50.81),以对手1/8的参数规模实现性能反超。
注:柱形自44分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差1.52分,与80B模型分差2.77分。
Qwen-Image-Bench 由阿里通义千问团队推出,与传统图像评测基准最大的区别在于:它不只看"画得像不像",而是考察模型在真实内容生产场景中的综合能力。
考"生成图像与真实图像的分布距离"或"图文语义匹配度"——与商业交付距离较远。
考"模型能否在真实工作流中输出可用结果"——涵盖文字渲染、物理一致性、风格控制、多轮编辑等维度。
七大维度:文字渲染、物理一致性、风格控制、构图美学、光影真实感、编辑稳定性、指令遵循。采用"自动指标+人工评分+LLM评审"三重校验。
更关键的一点:这个基准测试的是模型综合能力的"下限"——不是最好的一张图有多惊艳,而是面对多样化的真实需求时,模型能否稳定输出可用结果。10B参数登顶,意味着在效率与质量的平衡点上,Boogu-Image-0.1找到了一个更优解。
跑分只是入场券。我们更关心的是:在真实的内容生产流程里,它能走到哪一步?
一个诚实的注脚:跑分领先的选手,未必能在真实改稿流程中稳住阵脚。文字渲染翻车、编辑不可预期、物理逻辑缺失——这些问题在Benchmark里不会被扣分,但在设计师的改稿流程里,每一个都足以打断工作流。
Boogu-Image-0.1 的价值,不能只放在单张图质量里看。如果评价标准只是"哪张图最惊艳",顶级闭源模型依然有明显优势。但真实内容生产并不只有终稿交付这一种场景。
在终稿之前,还有大量前期工作:出素材、试风格、做候选、改局部、批量生成不同版本。这些前端环节,正是10B开源模型更容易进入的位置。
FP8原生量化版本相比FP16/BF16,权重存储降低约50%,推理显存开销下降约60%,为企业私有化部署提供了可行性。
尤其是在Agent工作流中,图像模型的调用方式正在发生变化。理想的生产模式是:Agent利用更低部署成本进行高频采样,再以同样成本筛选、编辑。延迟、显存开销、单位部署成本、高并发承载能力——这些指标的重要性,在Agent场景下被成倍放大。
Boogu-Image-0.1的10B参数+FP8精度组合,将图像生成的边际成本向下推了一大截。它未必能替代顶级闭源模型的高端输出,但作为Agent工作流中可以被反复调用的视觉模块,提供了一个极具性价比的选择。
图像模型的竞争,正在从"参数量的比拼"转向"质量、速度、成本之间的三角平衡"。Boogu-Image-0.1用一次反超证明了:在Agent驱动的生产级工作流中,未来真正能被大规模调用的图像模型,未必是最大的,而更可能是在三者之间找到更好平衡的那个。
Boogu-Image-0.1 已在 HuggingFace 开源社区发布,包含 Base / Turbo / Edit / FP8 四个版本,支持离线部署与商业使用。
HuggingFace → 搜索 Boogu-Image-0.1