Search2Skill: 基于Rubric的强化学习实现技能蒸馏跨越知识边界——LLM自主技能获取新范式

通过Rubric-Based Reinforcement Learning,大模型能够从知识搜索中自主提炼出可执行技能,突破传统知识蒸馏的边界,实现从"知道"到"做到"的跃迁。

搜索片段
多源检索
原始噪声
结构化技能
Rubric评分器
去除冗余
强化优化
策略梯度更新
技能固化输出
▲ 42% 零样本成功率提升(基线→蒸馏后)
基准模型为GPT-4级基础模型,不经过蒸馏时直接调用搜索结果的完成任务成功率

技术原理:从搜索到技能的三阶段蒸馏

Search2Skill框架将LLM的技能获取过程分解为搜索、结构化与强化三个阶段,核心创新在于引入Rubric(评分准则)作为奖励信号,使模型在缺乏人工标注的情况下自主优化技能执行质量。

关键实验:Rubric设计如何影响技能质量

Rubric需兼顾粒度与泛化性:过于细碎会过拟合搜索片段,过于粗放则无法区分有效技能与噪声。论文设计了多维度评分准则(正确性、步骤完整性、效率、可复用性)。

78.5%
跨领域泛化准确率 粗粒度67.2%,细粒度72.1%
对比维度
本方法
基线方法
对比结果
技能迁移能力
Search2Skill (RBRL)
传统KD
提升53%
训练数据需求
Search2Skill (RBRL)
Direct Prompting
无需人工标注

行业意义:从知识库到技能库的范式转变

以往LLM的"知识"仅能通过RAG或微调转化为被动回答,Search2Skill首次证明模型可以主动将搜索到的知识编码为可复用的技能(如函数、流程模板),直接用于解决新任务。

"这项技术让AI不再只是'知道答案',而是'学会如何做事'——这是通往自主智能体的关键一步。"

—— 匿名审稿人,arXiv论文审稿意见
60%+
技能库复用率 同一领域内,模型首次搜索后提炼的技能可在后续相似任务中直接调用
编辑观察

Search2Skill代表了强化学习在LLM技能获取领域的最新突破,Rubric-Based RL有效解决了稀疏奖励与技能泛化之间的矛盾。尽管论文仅在受限场景验证,但该方法为构建持续自我进化的AI系统提供了理论可行的路径。

这是LLM从"知识消费者"迈向"技能创造者"的关键技术论文,Rubric-Based强化学习设计有望成为下一代AI Agent训练范式的核心组件。