通过Rubric-Based Reinforcement Learning,大模型能够从知识搜索中自主提炼出可执行技能,突破传统知识蒸馏的边界,实现从"知道"到"做到"的跃迁。
Search2Skill框架将LLM的技能获取过程分解为搜索、结构化与强化三个阶段,核心创新在于引入Rubric(评分准则)作为奖励信号,使模型在缺乏人工标注的情况下自主优化技能执行质量。
Rubric需兼顾粒度与泛化性:过于细碎会过拟合搜索片段,过于粗放则无法区分有效技能与噪声。论文设计了多维度评分准则(正确性、步骤完整性、效率、可复用性)。
以往LLM的"知识"仅能通过RAG或微调转化为被动回答,Search2Skill首次证明模型可以主动将搜索到的知识编码为可复用的技能(如函数、流程模板),直接用于解决新任务。
"这项技术让AI不再只是'知道答案',而是'学会如何做事'——这是通往自主智能体的关键一步。"
Search2Skill代表了强化学习在LLM技能获取领域的最新突破,Rubric-Based RL有效解决了稀疏奖励与技能泛化之间的矛盾。尽管论文仅在受限场景验证,但该方法为构建持续自我进化的AI系统提供了理论可行的路径。
这是LLM从"知识消费者"迈向"技能创造者"的关键技术论文,Rubric-Based强化学习设计有望成为下一代AI Agent训练范式的核心组件。