大模型推理迎来"省钱判据":隐藏状态选择何时胜过多数投票,采样前即可预测
一篇新上线 arXiv 的论文提出"可解码性判据"(decodability criterion)——从模型隐藏状态计算出的一个标量指标,能在真正采样之前预测:隐藏状态选择与多数投票,这一局谁赢。当判据指向前者,一个需要 N 倍采样成本的方法,可以直接退场。
一篇新上线 arXiv 的论文提出"可解码性判据"(decodability criterion)——从模型隐藏状态计算出的一个标量指标,能在真正采样之前预测:隐藏状态选择与多数投票,这一局谁赢。当判据指向前者,一个需要 N 倍采样成本的方法,可以直接退场。
大模型的解码环节,是生成质量与推理成本交汇的咽喉。过去两年,两种策略在工程侧反复拉扯:
多数投票把"多试几次"变成策略——采样 N 条推理路径、对最终答案表决,效果稳健,但每个问题都付 N 倍生成成本。隐藏状态选择把"内部信号"变成策略——从模型内部表示里读出置信度、直接选出答案,一次前向,但输出时稳时不稳。
选哪个?过去只能靠试。
这篇论文想终结这种试错。它提出一个可计算的判据,在真正采样之前就预测两种策略的相对胜负:把一道成本选择题,变成一道判断题。
链路图为编辑对论文工作流的提炼;每一步的具体实现、阈值设定与验证任务,以 arXiv 原文为准。
判据的立足点,是它把"内部信号可不可靠"这件事量化了。论文从隐藏状态构造一个标量指标——"可解码性":它衡量隐藏状态能在多大程度上预测答案质量。可解码性越高,内部信号越可信,隐藏状态选择就越可能胜过多数投票。
多次采样 + 答案表决。稳健、通用,尤其在数学、逻辑等可验证任务上;代价是每个问题的生成成本 ≈ N 倍。
从内部表示提取置信/一致性信号选答案。单次前向、成本接近 1;风险是内部信号可能与真实质量脱节。
它不是一个"玄学分数"。
判据的计算完全基于模型自身的内部表示:不需要额外推理,不需要人工标注,也不需要在每个问题上重新校准。它把内部信号折叠成一个数字,与统一阈值比较后输出一个二值判断——选谁,一目了然。
论文经由 arXiv 公开上线。arXiv 正通过 arXivLabs 这类协作框架,把开放、社区、可复现变成平台的制度底色——这类研究的可信度,恰恰建立在全文公开、人人可复现之上。
注:以上为编辑对论文机制的精读式转述,具体公式与实验配置以原文为准。
成本账怎么算?多数投票在每个问题上都做 N 次完整生成,N 由服务方设定,成本随 N 线性上涨;隐藏状态选择只做 一次前向,判据本身是对隐藏状态的标量运算,边际开销几乎为零。
条形为相对生成成本示意,假设投票采样 N=8,实际 N 由服务方设定。投票可并行采样,墙上时间未必乘 N,但算力账单会。
当判据指向选择法,这 N-1 倍的生成成本,可以直接从账单上划掉。
这尤其戳中长思维链模型的痛点:一条推理链的生成成本数倍于普通回答,N 路采样在成本上几乎不可行。判据让"内部信号选答案"从碰运气的备胎,变成有依据的正选。
框住边界,不是为了否定这篇论文,而是为了看清它的位置:它不声称消灭投票,只声称——在它成立的地方,你可以不再需要投票。
多数投票的护城河是"多试几次",而判据让系统在采样前就知道"不必多试"——省算力与保质量,第一次不必二选一。
论文已在 arXiv 全量公开,全文、判据公式与实验细节可自由查阅。