AI·快讯
🧪 图像模型 · 基准突破

10B 参数击败 80B:开源图像模型 Boogu-Image-0.1 登顶基准,真实场景实测

2026 年 6 月,HuggingFace 上一个名为 Boogu-Image-0.1 的开源模型以 10B 参数在 Qwen-Image-Bench 上拿到 53.58 分,超越 20B 的 Qwen-Image-2512 和 80B 的 Hunyuan-Image-3.0。以对手 1/8 的参数量实现反超,但跑分之外的真实场景考验才刚刚开始。

综合公开信息整理 2026-07 全文约 4 分钟读完
#Boogu-Image #开源模型 #Qwen-Image-Bench #图像生成 #10B
🥇 53.58 Qwen-Image-Bench 总榜第一
10B 参数量,仅为对手 1/8
4 版本矩阵:Base / Turbo / Edit / FP8

⚡ 30 秒速览

  • 登顶数据:Qwen-Image-Bench 得分 53.58,领先 20B 的 Qwen-Image-2512(52.06)和 80B 的 Hunyuan-Image-3.0(50.81),参数仅对手 1/8 至 1/2。
  • 四版本矩阵:Base(文生图 + 密集文字)、Turbo(3-4 步快速出图)、Edit(局部编辑)、FP8(量化部署),覆盖从创作到落地的全链路。
  • 真实感出片惊艳:Turbo 版本生成的海边游客照、家庭生日照,光影与人物表情自然到「像朋友随手拍」,但文字渲染和物理细节仍有瑕疵。
  • 编辑能力双刃剑:Edit 能完成服装替换、物体移除等局部修改,但替换复杂对象时稳定性不足,一次修改可能带来新的形变。
  • 工程价值突出:FP8 量化版本显著降低部署成本,10B 参数在 Agent 高频调用场景下具备明显的边际成本优势。

01Qwen-Image-Bench Top 3 10B 以小博大

🥇 Boogu-Image-0.110B 参数 · 开源
53.58
Qwen-Image-251220B 参数 · 阿里
52.06
Hunyuan-Image-3.080B 参数 · 腾讯
50.81

注:柱形自 48 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 1.52 分,与第三名分差 2.77 分。参数规模差距最大达 8 倍。

02Qwen-Image-Bench:测的是综合能力,不是单张审美

这个基准与传统图像评测的区别非常直接:

传统图像基准

侧重单张画质、风格模仿、美学评分,与真实生产场景的「多轮改稿 + 文字准确 + 局部编辑」存在距离。

Qwen-Image-Bench

考的是「模型在复杂指令下的综合产出能力」——文字渲染、构图逻辑、物理一致性、多轮编辑稳定性,缺一不可。

但基准分数只是入场券。真实生产场景的考验,远比跑分复杂。

Boogu-Image-0.1 此次同步开源了四个版本,分别针对不同的生产环节:

Base文生图·密集文字
Turbo快速出图·真实感
Edit局部编辑·迭代
FP8量化部署·低成本

注:四个版本共享 10B 底座,Turbo 通常 3-4 步完成生成,FP8 为原生量化版本,降低显存与推理开销。

03真实场景三连测 Turbo → Base → Edit

我们按照「快速出图→复杂海报→局部编辑」的链路,逐一测试了 Boogu-Image-0.1 在生产级任务中的真实表现。

📸 Turbo:照片级真实感,发朋友圈毫无压力 真实感突出

  • 海边游客照:人物与栈道、夕阳、小镇融合自然,远处光源照亮左侧发丝,衣服褶皱真实垂落,背景虚焦处理营造出「朋友随手拍」的氛围。
  • 春节生日照:室内布局、装饰风格令人「好像在哪见过」,多人表情自然、空间关系到位,家庭抓拍感极强。
  • 动态动物照:小狗与猫在烟火气街道上追逐,画面整体像手机抓拍,但影子细节生硬,与真实物理表现有出入。
判断:Turbo 在真实感出片上展现了超越参数规模的表现,光影、景深和人物表情的控制力不输大模型,但物理细节和文字渲染仍是短板。

🎬 Base:港风电影海报,能接住艺术指令吗? 有叙事感,但质感不及闭源

  • Prompt 要求:《花样年华》风格,男女主角「靠得很近却实际无法接近」的疏离气质,玻璃反射、黄绿橙交织的光影,中英文标题加日期地点。
  • Base 表现:玻璃反射与光影交织到位,女性低垂眉眼、男性隐没暗处的构图精准还原了「疏离感」,人物之间有明确的情感关联。
  • 对比 ChatGPT Images 2.0:文字排版和光影质感差距明显——Base 画面右侧出现一条莫名其妙的光带,光源分布散乱,缺乏对物理世界逻辑的理解。
判断:Base 已能完成复杂海报的主体构图和氛围营造,但文字排版、光源逻辑和电影级质感与顶级闭源模型仍有明显差距。10B 的参数上限在这里显露无遗。

✂️ Edit:局部编辑,是惊喜还是惊吓? 可用但不稳定

  • 服装替换:将海报中女性改为白衬衫黑长裤——模型准确只替换服装,人物姿势、发型、面部轮廓、热水壶和光影氛围全部保住。
  • 物体移除:移除画面右侧红橙色光柱——修复后门框和桌面正常出现,无抠图痕迹,过渡平滑。
  • 动物替换:将小狗替换为浅棕色柯基——场景和光线保持,但柯基出现 3D 动漫质感,与背景不在同一图层,生硬感明显。
判断:Edit 能完成边界清楚的局部修改,但一旦涉及替换对象融入原有光影材质,稳定性就会明显下降。跑分不会扣分的地方,在改稿流程里却足以打断工作流。

04画质之外,算一笔成本账

Boogu-Image-0.1 真正的工程价值,不在单张图能有多惊艳,而在它把图像生成的边际成本向下推了一大截

FP8 原生量化版本,才是这次开源中最值得关注的信号。

相比 FP16/BF16,FP8 在单个数值位宽上更低,权重存储和部分计算链路开销同步下降。10B 参数 + FP8 精度的组合,意味着企业私有云或本地部署方案的可用性——尤其在 Agent 高频调用场景下,延迟、显存开销、单位部署成本、高并发承载能力会成为新的胜负手。

Base

文生图

高质量生成,密集文本渲染,适合复杂海报与排版任务

Turbo

快速出图

3-4 步生成,照片级真实感,适合批量素材与快速迭代

Edit

局部编辑

双语指令编辑,主体替换与移除,适合改稿工作流

FP8

量化部署

内存与推理成本降低,适合 Agent 高频调用与私有化部署

注:四个版本共享同一底座,FP8 为原生量化而非训练后压缩,在保持输出质量的前提下降低部署门槛。

顶级闭源模型在输出质量上仍有明显优势,但面对 Agent 的高频并发调用时,也会为企业带来难以承受的账单开销。10B 模型的量化部署版本,谈不上替代,但它是需求分层后的一个可靠选择。

05交付红线:跑分没扣分,但改稿会出事

Boogu-Image-0.1 的位置其实很清楚:它确实在 Benchmark 上用 10B 击败了 80B,这份以小博大的工程能力值得尊重。但「反超」的含金量,需要放在真实需求里重新评估。

三个绕不开的坎:

文字渲染:图像模型生成文字,本质是在图像空间里生成一组符合文字形态的视觉纹理,不是调用字体文件。中文笔画密度高、结构复杂,小字号文字很容易在压缩-去噪-重建过程中丢失关键笔画。这在 Benchmark 里不会扣分,但在海报标题、产品详情页里,每一个错字都是事故。

编辑不可预期:生成式编辑不是图层修改。模型修改某个区域时,会结合整张图的语义、光影、纹理重新生成局部内容,掩码区域和非掩码区域很难完全隔离。用户只想改标题,模型却可能连带影响周围字体和构图稳定性。每一次局部修复都像投掷概率骰子。

物理逻辑缺失:Base 版本画面中那条「莫名其妙的光带」,暴露了模型对物理世界光源分布缺乏理解。这在单张审美里可能被忽略,但在商业级视觉交付中,一眼就能被识破。

编辑核心判断

图像模型正在从「参数量的比拼」转向「质量、速度、成本之间的综合平衡」。Boogu-Image-0.1 用一个反超告诉我们:下一阶段谁能在这三者之间找到更好的帕累托前沿,谁才能真正进入 Agent 驱动的生产级工作流。

开源可用

Boogu-Image-0.1 已开源至主流社区,搜索模型名即可获取全部版本与评测资源。

开源社区搜索 Boogu-Image-0.1