首份即时零售智能体可信规范正式发布,简单任务准确率要求不低于95%
8月18日,中国人工智能产业发展联盟第十八次全体会议上,中国信通院联合淘宝闪购正式发布《即时零售智能体可信基本要求》,围绕三大能力维度与六大安全领域构建评估体系,为即时零售AI Agent划定可量化的可信底线。这是即时零售领域首份针对AI Agent的系统性可信规范。
8月18日,中国人工智能产业发展联盟第十八次全体会议上,中国信通院联合淘宝闪购正式发布《即时零售智能体可信基本要求》,围绕三大能力维度与六大安全领域构建评估体系,为即时零售AI Agent划定可量化的可信底线。这是即时零售领域首份针对AI Agent的系统性可信规范。
规范构建了一套覆盖智能体全生命周期的可信评估框架。技术侧聚焦三大能力维度,安全侧覆盖六大领域,二者共同构成评估体系的双支柱。
智能体能否完整理解并执行用户指令,不遗漏关键步骤
▶ 能力维度任务执行结果与预期目标的吻合程度,误差在可接受范围内
▶ 能力维度在合理时间内完成交付,响应速度与资源消耗达到平衡
▶ 能力维度六大安全领域则构成可信底座:
注:三大能力维度侧重智能体"能不能做好",六大安全领域侧重"是否可信赖"——两者结合构成完整的可信评估坐标系。
规范最受关注的部分,是给出了明确的量化指标。这些数字不是拍脑袋,而是基于即时零售场景中高约束、多意图、实时变化的用户需求推导而来。
注:简单任务指单步指令、无分支依赖的操作;复杂任务指多步推理、需调用外部工具或依赖前序结果的任务。接口成功率衡量智能体与外部系统交互的稳定性。
一个诚实的注脚:这些指标是底线而非天花板。规范的意义在于为行业建立"最低可信水位",企业可以在此基础上提出更高要求。
即时零售场景中的AI Agent,面临的是高约束、多意图、实时变化的用户需求——用户要的不只是"推荐一个商品",而是"30分钟内送到、价格最优、且有货"。任何一个环节出错,体验都会归零。
传统智能体评估框架,解决不了这个问题。
侧重模型能力(知识问答、推理测试),与实际交付场景脱节,缺少对任务执行全链路的验证。
从"模型能做什么"转向"智能体能不能把事做完"——覆盖意图理解、工具调用、结果交付、异常兜底全流程。
中国信通院人工智能研究所安全治理部工程师郭苏敏在会议中表示:"该技术规范填补行业可信评估空白,为人工智能技术在即时零售领域应用筑牢安全底线。"
注:规范并非取代传统模型评测,而是在其之上叠加了一层面向交付场景的"可信层"——两者互补而非互斥。
淘宝闪购科技法务负责人郝鹏在解读规范时提到一个细节:"AI普惠的理念也体现在了此次规范的编写中。"规范面向特定群体与民生场景,提出宜具备语音交互能力支持老年人便捷使用等内容。
即时零售智能体除了"能办事",还可以"有温度"。
这个案例折射出规范的深层逻辑:可信不只是技术指标,还包括对不同用户群体的可及性。一个"可信"的智能体,应该让更多人用得起来、用得放心。
规范的出台并非偶然。2026年上半年,从国家到地方层面,围绕智能体与即时零售的政策密集落地,为行业搭建了清晰的制度预期。
三条关键政策线,共同催生了这份规范。
注:时间线显示,从国家政策到地方行动再到企业落地,整个链条在4个月内完成闭环——速度本身说明行业对可信标准的迫切需求。
参编单位的阵容也值得注意:蚂蚁、百度、阶跃星辰、MiniMax、同盾——既有互联网大厂,也有AI创业公司,还有安全科技企业。这种构成确保了规范既有前瞻性,又接地气。
可信规范的价值不在于"约束",而在于为整个行业建立了一个可量化的"信任起点"。当简单任务准确率95%成为基线,竞争就从"能不能做"转向"做得多好"——这恰恰是即时零售智能体从尝鲜走向规模化的关键一步。
淘宝闪购已开放MCP能力,AI可直连15大业务场景。规范全文可通过中国人工智能产业发展联盟渠道查阅,即时零售智能体可信评估同步启动。
中国人工智能产业发展联盟 → 查阅规范* 规范文本及评测细则以官方发布版本为准