阿里发布 Qwen-Image-3.0:文本输入提升 4.5 倍至 4.5K Token,一页需求说明直接画成图
7 月 21 日,阿里发布第三代图像生成基础模型 Qwen-Image-3.0:最高支持 4.5K Token 长文本输入,原生渲染 12 种语言、20 多种字体,可一次生成含公式、几何图形、逻辑推导步骤的知识图解与多层嵌套 UI——生图竞争的焦点,正从「画得美」转向「听得懂复杂需求」。
7 月 21 日,阿里发布第三代图像生成基础模型 Qwen-Image-3.0:最高支持 4.5K Token 长文本输入,原生渲染 12 种语言、20 多种字体,可一次生成含公式、几何图形、逻辑推导步骤的知识图解与多层嵌套 UI——生图竞争的焦点,正从「画得美」转向「听得懂复杂需求」。
此前的文生图用法更接近「念咒」:把需求压缩成几十个词的短指令,剩下的交给模型脑补,不满意就再来一轮。Qwen-Image-3.0 把输入上限拉到 4.5K Token——画面结构、文字内容、视觉风格、排版要求可以一次写全。
注:「4.5 倍」为官方口径,前代输入上限未在报道中单列,此处按 4.5K ÷ 4.5 推算约为 1K Token;柱形按真实比例绘制(零起点),仅供直观对比。
需求压缩成简短指令 → 多轮生成 → 人工调整,返工是常态。
画面结构、文字内容、视觉风格、排版要求一次写清。阿里称有助于减少多轮生成和后续人工调整。
原文点名三类最能吃到长提示词红利的场景:
背后的能力指向很明确:过去文生图最容易翻车的环节是「在图上写字」。阿里称新模型重点提升了复杂指令理解、文字渲染、空间布局与多层信息组织能力,并支持 12 种语言与 20 多种字体的原生渲染——都是在补这块短板。
Qwen-Image-3.0 采用图像生成与编辑一体化架构,将文字渲染、图像细节和知识理解能力同时用于生成和编辑两类任务。
生成工具出初稿,修图软件改细节,排版工具调结构——每次切换都可能引入文字变化、风格不一致、结构偏移。
同一模型内连续完成初次生成与后续修改,不必在多个工具之间切换;价值正落在减少二次编辑中的漂移与跳变。
以上四步均在同一模型内完成。官方给出的任务清单还包括:古画修复、全景图扩展、手绘草图转演示文稿、多镜头视角生成。
当提示词长度不再是瓶颈,生图模型的分水岭正在从「画工」转向对复杂指令的理解与信息组织能力。
场景清单来自阿里官方发布;其中数学试卷、网页界面、影视分镜对应本次主打的复杂指令与多层信息组织能力。
Qwen-Image-3.0 已在阿里云百炼与千问 AI 平台开放 API 邀测。
Qwen Studio、千问 App 的体验功能计划上线,具体时间待官方公布。
bailian.console.aliyun.com → 申请 API 邀测