📄 场景文本编辑 · ICML 2026

从中文到12种语言'无痕改字':美图MT Lab场景文本编辑新方案被ICML 2026录用

美图影像研究院(MT Lab)提出面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,无需分层文件、无需预设字表,即可实现从中文到日、俄、韩、泰等12种语言的无痕改字,在AnyText基准上取得最优性能,已被机器学习顶级会议ICML 2026录用。

综合公开信息整理 2026年 全文约3分钟读完
#场景文本编辑 #ICML 2026 #美图MT Lab #多语种 #无痕改字
12 种语言 中文、英文、日文、俄文、韩文、泰文等
4000 对 冷却训练精标配对数据
2 阶段 自监督预训练 + 冷却微调

⚡ 30秒速览

  • 核心突破:从"依赖分层文件"到"端到端自提示",无需预设字表即可实现多语种无痕修改,字体风格与画面质感高度一致。
  • 技术路线:两阶段训练范式——自监督预训练保证泛化能力,冷却微调(4000对精标数据)确保风格一致性,显式解耦"内容生成"与"风格保持"。
  • 能力覆盖:中文、英文、日文、俄文、韩文、泰文、阿拉伯语、法语、德语、意大利语、印地语、斯瓦希里语等12种语言,在AnyText基准上编辑准确性与风格一致性均最优。
  • 落地应用:已集成至美图秀秀"无痕改字"功能,突破预设词表限制,支持小语种文本编辑。
  • 学术认可:被机器学习三大顶会之一ICML 2026录用,论文与项目主页已公开。

01为什么"无痕改字"这么难?两个痛点

"把这几个字改下,其它的什么都别动。"——这个需求看似简单,实则极难。文字抠不出来、找不到匹配字体、背景留下修改痕迹……即使是专业设计师,也很难做到"看不出来改过"。

目前主流方法分两条路,但各有硬伤:

依赖图像修补

容易丢失原始文本区域的关键信息,导致字体细节和风格一致性下降,改完"一眼假"。

依赖OCR或固定字表

模型被限定在预设字符集内,遇到多语言、长尾字符或开放词汇时泛化能力急剧下降。

美图MT Lab的方案跳出了这两条路的框架——直接从输入图像中提取风格信息,结合目标文本生成高保真字形提示,在统一表示空间中完成编辑。不需要额外编码器,端到端搞定。

注:传统方法需要分层文件或预设字表,本方案仅需一张输入图像和目标文本,即可输出风格一致的编辑结果。

02自提示 + 两阶段训练如何做到"无痕"

方案的核心是自提示机制:从原始图像中提取像素级风格信息(颜色、纹理、排版),同时通过渲染目标文本生成高保真字形图,两者与完整图像在像素空间拼接,输入多模态扩散Transformer,实现细粒度对齐与生成。

输入图像风格提示提取字形提示生成像素空间拼接多模态扩散Transformer输出编辑结果

训练策略上采用两阶段范式,兼顾泛化与一致性:

阶段一 自监督预训练:大规模图文数据,冻结编码器与解码器,仅优化Transformer主干。建立字形结构与视觉语义的对应关系,不引入特定风格约束,避免过拟合。
阶段二 冷却微调:约4000对人工筛选的高质量配对数据,在局部文本区域施加约束,显式解耦"内容生成"与"风格保持",实现准确替换。

注:预训练阶段负责泛化能力,冷却阶段负责风格一致性——两者缺一不可。消融实验表明,缺少任一阶段都会显著影响最终效果。

03性能与覆盖12种语言 + AnyText最优

定量实验结果显示,在中英文基准AnyText上,该方案在编辑准确性和风格一致性的各项评估指标中均取得最优性能

编辑准确性
最优
风格一致性
最优
多语言泛化
领先
长尾字符鲁棒性
领先

注:柱形为相对性能示意,非精确数值;"最优"表示在AnyText基准上超越此前所有方法,"领先"表示显著优于已有方案。

多语种能力覆盖12种语言,包括中文、英文、日文、俄文、韩文、泰文、阿拉伯语、法语、德语、意大利语、印地语、斯瓦希里语,在MSTEdit测试集上整体优于已有方法。

中文 英文 日文 俄文 韩文 泰文 阿拉伯语 法语 德语 意大利语 印地语 斯瓦希里语

此外,在长尾字符、手动设计符号及现实中不存在的字符(OOV)上,方案也表现出良好鲁棒性,真正实现了开放词汇的文本编辑。

04它能做什么?三个典型场景

🖋️ 中文场景:替换文字,保留笔触与质感 风格一致

  • 输入一张包含中文文字的图片,指定目标文本,无需分层文件即可完成替换。
  • 字体风格、颜色、纹理、背景光影与原始图像高度一致,无修补痕迹。
  • 在AnyText中文基准上编辑准确性达最优
关键能力:从输入图像中提取像素级风格信息,确保替换后的文字与原始画面融为一体。

🌐 多语种:日、俄、韩、泰"无痕"切换 跨语言

  • 支持12种语言的文本编辑,包括日文、俄文、韩文、泰文等小语种。
  • 突破传统改字预设词表的限制,无需为每种语言单独训练模型
  • 在MSTEdit多语种测试集上整体优于已有方法。
多语言能力来自自监督预训练阶段建立的通用视觉语义对应关系,而非特定语种的标注数据。

🔣 长尾字符:非常用符号也能准确替换 开放词汇

  • 长尾字符、手动设计符号、甚至现实中不存在的字符(OOV)均表现鲁棒。
  • 无需依赖OCR识别结果或固定字表,真正实现开放词汇文本编辑。
  • 消融实验表明,字形提示(glyph prompt)对提升长尾字符准确性贡献最大。
开放词汇能力是区分"实验室演示"与"真实可用"的关键分水岭——本方案迈过了这道门槛。

05为什么是美图做出来了?

答案藏在业务场景里。美图旗下产品每天处理海量图片,文字编辑是用户高频刚需。从"美图秀秀无痕改字"功能反推技术需求,再倒逼出顶会论文——这是一条场景驱动研究的典型路径。

但更值得关注的是方案本身的工程哲学:两阶段训练 + 自提示机制,没有追求花哨的架构创新,而是把"数据质量"和"工程实现"做到极致。4000对精标数据带来的提升,说明高质量配对数据比更复杂的网络设计更能带来实际收益。

一个诚实的注脚:

方案在AnyText基准上取得最优,但真实场景的复杂度仍远超基准——光照变化、透视畸变、艺术字体等极端情况,还需要更多测试。不过,从"依赖分层文件"到"端到端自提示"的范式转变,已经为行业提供了一个可规模化的新方向。

编辑核心判断

场景文本编辑正在从"专用工具"走向"通用能力",但真正的瓶颈已从模型架构转向数据质量与工程实现——4000对精标数据带来的提升,说明高质量配对数据比更复杂的网络设计更能带来实际收益。美图MT Lab的方案证明:当业务场景足够深,技术突破自然会发生。

现在就能用

核心技术已应用于美图秀秀"无痕改字"功能,支持多语种文本编辑,打开应用即可体验。

美图秀秀 → 无痕改字