通义千问发布 Qwen-Image-Edit:全能图像编辑登顶多项基准,语义与外观双重编辑突破
基于 20B 参数 Qwen-Image 模型,将文本渲染能力延展至图像编辑领域,实现语义与外观双重编辑,在多项公开基准测试中达到领先水平,成为图像编辑基础模型的新标杆。
基于 20B 参数 Qwen-Image 模型,将文本渲染能力延展至图像编辑领域,实现语义与外观双重编辑,在多项公开基准测试中达到领先水平,成为图像编辑基础模型的新标杆。
Qwen-Image-Edit 将输入图像同时送入 Qwen2.5-VL(视觉语义控制)与 VAE Encoder(视觉外观控制),从而兼具两种编辑能力。这意味着用户可以在「保持像素不变」和「允许整体变化但语义一致」之间自由选择。
允许整体像素变化,但保持角色、内容语义一致。适用:风格迁移、视角旋转、IP 创作、背景重绘。
保持图像部分区域完全不变,仅对指定元素增、删、改。适用:添加指示牌、删除头发丝、修改颜色、人物背景调整。
注:语义编辑与外观编辑并非互斥关系,实际场景中常组合使用。例如先做语义风格迁移,再对外观细节做微调。
一个直观的例子:输入 Qwen 吉祥物卡皮巴拉的原始图像,通过语义编辑可以生成不同风格、不同姿势、不同背景的变体,而角色身份始终一致。这意味着 IP 创作者可以基于一张原图,批量产出多样化内容。
得益于 Qwen-Image 在文本渲染领域的积累,Qwen-Image-Edit 实现了对图片中文字的精准编辑——不只是替换文字,还能保留原有的字体、字号、颜色和排版风格。
注:文字编辑能力对字体清晰度、字号大小有一定依赖。极细字体或艺术变形文字可能需要手动框选辅助。
单次编辑未必完美,但 Qwen-Image-Edit 支持链式、逐步的编辑方式——先框选修改,再对细节微调,直到效果满意。
以修复 Qwen-Image 生成的《兰亭集序》书法作品为例:原图中有多个汉字存在生成错误。通过链式编辑,逐步修正了「稽」「亭」等字——其中「稽」字右下角从「日」修正为「旨」,经过两轮微调后达到正确效果。
注:链式编辑适用于对精度要求极高的场景(如书法、设计稿、商标文字)。生僻字或结构复杂字可能需要额外的微调轮次。
Qwen-Image-Edit 的能力落地场景非常广泛。以下三个方向,已经可以在实际工作中直接使用:
基于一张吉祥物原图,通过语义编辑生成不同风格、不同姿势的变体,甚至制作完整的 MBTI 十六型人格表情包——无需重新绘制,一张原图即可拓展整个 IP 系列。
输入一张人物头像,一键转换为 吉卜力风格或其他艺术风格。适用于虚拟形象创作、社交媒体头像、品牌视觉物料等场景。
对商品图片进行 背景替换、人物服装更换、微小物体删除(如头发丝、瑕疵)。外观编辑模式确保主体区域完全不变,只改目标区域。
注:以上场景均已在 Qwen-Image-Edit 上验证通过。实际效果因图像复杂度和编辑指令的清晰度而有所差异。
将文本渲染与图像编辑深度融合,Qwen-Image-Edit 开辟了「文字精准编辑」的新赛道,但在生僻字、复杂场景下仍需链式迭代。这标志着图像编辑正在从「像素级操作」走向「语义级理解」——单次精度仍有提升空间,但方向已经明确。
模型已开源发布,登录通义千问官方应用选择「图像编辑」功能即可体验完整能力。
通义千问应用 → 选择「图像编辑」