🧪 模型 · 技术发布

通义千问发布 Qwen-Image-Edit:全能图像编辑登顶多项基准,语义与外观双重编辑突破

基于 20B 参数 Qwen-Image 模型,将文本渲染能力延展至图像编辑领域,实现语义与外观双重编辑,在多项公开基准测试中达到领先水平,成为图像编辑基础模型的新标杆。

来源:综合公开信息整理 2026-07-24 全文约 3 分钟读完
#Qwen-Image-Edit #图像编辑 #语义编辑 #文字编辑 #通义千问
🏆 SOTA 多项图像编辑基准领先
20B 模型参数规模
双模态 语义 + 外观双重编辑
⚡ 30 秒速览
  • 核心突破:将文本渲染与图像编辑深度融合,实现中英文双语精准文字编辑,保留字体、字号与风格。
  • 双重编辑:语义编辑(风格迁移、视角旋转、IP 创作)与外观编辑(元素增删改、背景替换)并行,一套模型覆盖两种范式。
  • 链式修正:支持逐步、迭代式编辑——先框选再微调,最终获得理想效果,尤其适合生僻字、复杂场景。
  • 开源可用:模型已公开发布,可通过官方应用直接体验「图像编辑」功能,技术细节同步公开。

01语义与外观双重编辑 一套模型,两种范式

Qwen-Image-Edit 将输入图像同时送入 Qwen2.5-VL(视觉语义控制)与 VAE Encoder(视觉外观控制),从而兼具两种编辑能力。这意味着用户可以在「保持像素不变」和「允许整体变化但语义一致」之间自由选择。

两种模式,分别解决什么问题?

🎨 语义编辑(Semantic)

允许整体像素变化,但保持角色、内容语义一致。适用:风格迁移、视角旋转、IP 创作、背景重绘。

🔧 外观编辑(Appearance)

保持图像部分区域完全不变,仅对指定元素增、删、改。适用:添加指示牌、删除头发丝、修改颜色、人物背景调整。

语义风格/视角/IP 创作
外观元素增删改/背景
中+英双语文字编辑
链式逐步迭代修正

注:语义编辑与外观编辑并非互斥关系,实际场景中常组合使用。例如先做语义风格迁移,再对外观细节做微调。

一个直观的例子:输入 Qwen 吉祥物卡皮巴拉的原始图像,通过语义编辑可以生成不同风格、不同姿势、不同背景的变体,而角色身份始终一致。这意味着 IP 创作者可以基于一张原图,批量产出多样化内容。

🔓 模型已开源:Qwen-Image-Edit 权重与评测流程已公开,开发者可通过官方渠道获取,支持本地部署与二次开发。

02精准文字编辑 中英文双语,保留字体与风格

得益于 Qwen-Image 在文本渲染领域的积累,Qwen-Image-Edit 实现了对图片中文字的精准编辑——不只是替换文字,还能保留原有的字体、字号、颜色和排版风格。

两个案例,直观感受:

📄 英文海报文字替换 字体保留

  • 原图中包含指定英文标语,模型精准识别文字区域。
  • 将目标文字替换为新的英文内容,字体、字号、颜色与原图完全一致
  • 背景纹理与文字阴影等细节同步保留,无生硬感。
编辑效果:自然融合,文字区域与周围像素过渡平滑,无可见边界。

🀄 中文海报大字与小字同步修改 中英双语

  • 同时处理海报中的标题大字与底部小字,两种字号均精准编辑
  • 中文字形结构复杂,模型仍能正确生成目标汉字,且风格统一。
  • 支持多行文字的整体替换,保持行距与对齐方式。
编辑效果:精准到位,大字醒目、小字清晰,中英文混合场景同样适用。

注:文字编辑能力对字体清晰度、字号大小有一定依赖。极细字体或艺术变形文字可能需要手动框选辅助。

03链式编辑 逐步迭代,逼近理想效果

单次编辑未必完美,但 Qwen-Image-Edit 支持链式、逐步的编辑方式——先框选修改,再对细节微调,直到效果满意。

一个典型的链式编辑流程:
① 识别错字② 框选区域③ 首次修改④ 检查细节⑤ 二次微调⑥ 最终确认

以修复 Qwen-Image 生成的《兰亭集序》书法作品为例:原图中有多个汉字存在生成错误。通过链式编辑,逐步修正了「稽」「亭」等字——其中「稽」字右下角从「日」修正为「旨」,经过两轮微调后达到正确效果。

🖌️ 书法作品错字修复 链式迭代

  • 第一轮:框选「稽」字区域,模型将其修正,但右下角仍为「日」而非「旨」。
  • 第二轮:再次框选「日」部分,指示模型将其改为「旨」,细节精准到位
  • 最终:整幅作品所有错字全部修正,获得完全正确的《兰亭集序》书法版本。
链式价值:不追求一次完美,而是通过多轮迭代降低单次编辑难度,最终逼近理想效果。

注:链式编辑适用于对精度要求极高的场景(如书法、设计稿、商标文字)。生僻字或结构复杂字可能需要额外的微调轮次。

04从 IP 创作到日常设计 降低视觉内容创作门槛

Qwen-Image-Edit 的能力落地场景非常广泛。以下三个方向,已经可以在实际工作中直接使用:

🧸

IP 多样化创作

基于一张吉祥物原图,通过语义编辑生成不同风格、不同姿势的变体,甚至制作完整的 MBTI 十六型人格表情包——无需重新绘制,一张原图即可拓展整个 IP 系列。

🎨

风格迁移与虚拟形象

输入一张人物头像,一键转换为 吉卜力风格或其他艺术风格。适用于虚拟形象创作、社交媒体头像、品牌视觉物料等场景。

📷

产品图与背景调整

对商品图片进行 背景替换、人物服装更换、微小物体删除(如头发丝、瑕疵)。外观编辑模式确保主体区域完全不变,只改目标区域。

注:以上场景均已在 Qwen-Image-Edit 上验证通过。实际效果因图像复杂度和编辑指令的清晰度而有所差异。

编辑核心判断

将文本渲染与图像编辑深度融合,Qwen-Image-Edit 开辟了「文字精准编辑」的新赛道,但在生僻字、复杂场景下仍需链式迭代。这标志着图像编辑正在从「像素级操作」走向「语义级理解」——单次精度仍有提升空间,但方向已经明确。

现在就能用

模型已开源发布,登录通义千问官方应用选择「图像编辑」功能即可体验完整能力。

通义千问应用 → 选择「图像编辑」