大型语言模型通常能够遵循单条指令,但当多个约束需要同时满足时,整体成功率会随约束数量增加而快速下降,并可能在某个复杂度阈值附近出现类似“相变”的骤降。
Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction 论文标题
现实中的下降可能更复杂:约束之间可能相互冲突,后加入的要求可能覆盖先前要求,模型也可能在生成过程中丢失对早期约束的持续记忆。因此,成功率未必平滑下降,而可能在达到某个约束数量或交互复杂度后快速下坠。
“相变”在这里更可能是对性能曲线形态的类比,而不是物理学意义上的严格相变。关键仍要看完整论文是否展示清晰阈值、跨模型复现结果,以及对阈值来源的统计检验。
四类评测并不位于同一维度:横向比较它们处理的是原子要求还是组合要求,纵向比较它们是否能被硬性验证。
IFEval更适合测量格式、词语或结构等原子约束;FollowBench及类似多约束基准更接近组合任务。聊天偏好可能掩盖硬约束违规,而结构化解码也不能自动保证事实正确、逻辑一致或语义要求完整。
表现完成大部分任务,却忽略一条或几条要求。
可能原因长指令中的低显著性要求获得较少注意力。
表现前面已经承诺的条件在后续生成中被遗忘。
可能原因持续维护约束的记忆负担增加。
表现格式合规,却违反内容限制;后置要求破坏前置条件。
可能原因优先级、范围或相互关系未被正确解析。
表现各段单独看似合规,组合后出现重复、矛盾、顺序错误。
可能原因局部生成能力强于全局约束维护能力。
表现模型声称满足全部要求,逐项检查后仍有遗漏。
可能原因生成与验证共享相似的推理偏差。
如果进一步将这些模式与约束数量、类型和模型规模交叉分析,便有机会区分失败来自记忆负担、推理复杂度、冲突解决能力,还是评测方法本身。
真实用户往往同时指定格式、长度、语气、事实范围、受众、禁用内容、输出顺序和异常处理方式。不同应用对遗漏的容忍度并不相同。
遗漏通常可以人工修改,主要增加体验和编辑成本。
字段缺失、格式错误或边界条件遗漏,可能直接阻断下游程序。
权限、合规、字段完整性和业务规则需要同时满足,局部正确但全局违规的风险较高。
必须进行独立校验,不能用语言流畅度或单项准确率替代整体可靠性。
工程上更稳妥的做法,是把复杂任务拆成多个阶段,而不是单纯把所有要求堆叠在一个提示词中。
主路径表示证据逐项累积;任何一个关键未知项都必须进入暂停区,不能直接升级为论文结论。