从中文到12种语言'无痕改字':美图MT Lab场景文本编辑新方案被ICML 2026录用
美图影像研究院(MT Lab)提出面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,无需分层文件、无需预设字表,即可实现从中文到日、俄、韩、泰等12种语言的无痕改字,在AnyText基准上取得最优性能,已被机器学习顶级会议ICML 2026录用。
美图影像研究院(MT Lab)提出面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,无需分层文件、无需预设字表,即可实现从中文到日、俄、韩、泰等12种语言的无痕改字,在AnyText基准上取得最优性能,已被机器学习顶级会议ICML 2026录用。
"把这几个字改下,其它的什么都别动。"——这个需求看似简单,实则极难。文字抠不出来、找不到匹配字体、背景留下修改痕迹……即使是专业设计师,也很难做到"看不出来改过"。
目前主流方法分两条路,但各有硬伤:
容易丢失原始文本区域的关键信息,导致字体细节和风格一致性下降,改完"一眼假"。
模型被限定在预设字符集内,遇到多语言、长尾字符或开放词汇时泛化能力急剧下降。
美图MT Lab的方案跳出了这两条路的框架——直接从输入图像中提取风格信息,结合目标文本生成高保真字形提示,在统一表示空间中完成编辑。不需要额外编码器,端到端搞定。
注:传统方法需要分层文件或预设字表,本方案仅需一张输入图像和目标文本,即可输出风格一致的编辑结果。
方案的核心是自提示机制:从原始图像中提取像素级风格信息(颜色、纹理、排版),同时通过渲染目标文本生成高保真字形图,两者与完整图像在像素空间拼接,输入多模态扩散Transformer,实现细粒度对齐与生成。
训练策略上采用两阶段范式,兼顾泛化与一致性:
注:预训练阶段负责泛化能力,冷却阶段负责风格一致性——两者缺一不可。消融实验表明,缺少任一阶段都会显著影响最终效果。
定量实验结果显示,在中英文基准AnyText上,该方案在编辑准确性和风格一致性的各项评估指标中均取得最优性能。
注:柱形为相对性能示意,非精确数值;"最优"表示在AnyText基准上超越此前所有方法,"领先"表示显著优于已有方案。
多语种能力覆盖12种语言,包括中文、英文、日文、俄文、韩文、泰文、阿拉伯语、法语、德语、意大利语、印地语、斯瓦希里语,在MSTEdit测试集上整体优于已有方法。
此外,在长尾字符、手动设计符号及现实中不存在的字符(OOV)上,方案也表现出良好鲁棒性,真正实现了开放词汇的文本编辑。
答案藏在业务场景里。美图旗下产品每天处理海量图片,文字编辑是用户高频刚需。从"美图秀秀无痕改字"功能反推技术需求,再倒逼出顶会论文——这是一条场景驱动研究的典型路径。
但更值得关注的是方案本身的工程哲学:两阶段训练 + 自提示机制,没有追求花哨的架构创新,而是把"数据质量"和"工程实现"做到极致。4000对精标数据带来的提升,说明高质量配对数据比更复杂的网络设计更能带来实际收益。
一个诚实的注脚:
方案在AnyText基准上取得最优,但真实场景的复杂度仍远超基准——光照变化、透视畸变、艺术字体等极端情况,还需要更多测试。不过,从"依赖分层文件"到"端到端自提示"的范式转变,已经为行业提供了一个可规模化的新方向。
场景文本编辑正在从"专用工具"走向"通用能力",但真正的瓶颈已从模型架构转向数据质量与工程实现——4000对精标数据带来的提升,说明高质量配对数据比更复杂的网络设计更能带来实际收益。美图MT Lab的方案证明:当业务场景足够深,技术突破自然会发生。
核心技术已应用于美图秀秀"无痕改字"功能,支持多语种文本编辑,打开应用即可体验。
美图秀秀 → 无痕改字