从整段调参到分段优化:自动提示优化进入模块化时代,12 项任务平均提升 9.8 分
arXivLabs 最近开放的一项自动提示优化研究,提出「分段式」优化思路:不再把 prompt 当作一整块不可拆的文本,而是拆成角色、任务、格式、约束四个可独立寻址的模块。论文公开的基准显示,这套方法比整体式优化平均提升 9.8 分,且优化结果能在多个开源模型间迁移。
arXivLabs 最近开放的一项自动提示优化研究,提出「分段式」优化思路:不再把 prompt 当作一整块不可拆的文本,而是拆成角色、任务、格式、约束四个可独立寻址的模块。论文公开的基准显示,这套方法比整体式优化平均提升 9.8 分,且优化结果能在多个开源模型间迁移。
过去的 prompt 调优是「整体式」的:把整条 prompt 当成一个不透明字符串,靠人来试错,或靠算法在完整序列上做黑盒搜索。
但一条真实 prompt 往往是多种约束的混合物——角色设定、任务指令、输出格式、边界条件全部拧在一起。改一个词,可能同时影响语气、结构、事实性三个目标。
整体式调优开始失灵。
一条 prompt 是一个整体;一次改动影响全部目标;优化过程黑盒;迁移到新任务需要从头再调。
每个 segment 有独立职责;可单独替换、回滚、复测;优化轨迹可审计;同一套分段模板可跨任务迁移。
注:以上对比是论文方法框架的概括,不是某家产品的跑分排序。分段式真正的价值,是把 prompt 从「一次性调参」变成「可复用资产」。
注:图为论文公开基准的简化示意,纵轴自 55 分起截断,非零起点。重点看相对差距,不要当作绝对分数。
更值得注意的是迁移表现。论文在 3 个开源模型系列上做了交叉验证:用 A 模型上搜索到的分段结构,直接套到 B 模型上,仍然能带来正向收益。
这说明分段优化学到的不是某条指令的巧合,而是任务结构里的共性。
第一,上下文越来越长,prompt 本身变得更复杂。整体式调优的搜索空间随之指数膨胀,已经很难靠「整段重写」找到最优解。
第二,评测标准变了。大模型能力评测从单轮问答,转向可验证的任务完成度。prompt 优化因此需要可复现、可审计,而不再是暗箱里的试错。
第三,开放协作的基础设施出现了。论文选择通过 arXivLabs 开放,把框架、评测协议和分段模板全部公开,承诺社区性、开放性与数据隐私。
这也是「炼丹」开始变成「工程」的节点。
从 monolithic 到 modular,表面是 prompt 的拆分,实际上是优化逻辑从「不可解释的试错」转向「可复盘的工程迭代」。
Prompt 优化的下一个分水岭不是模型更强,而是优化过程能不能被拆开、被审计、被协作。谁能把「炼丹」变成工程,谁就能把一次性的能力提升沉淀成可复用的基础设施。
论文与框架已通过 arXivLabs 开放。在 arXiv 上检索原题,即可查看完整论文、评测协议与分段模板。
arXivLabs → 打开论文页