📋 政策 · 可信规范

首份即时零售智能体可信规范正式发布,简单任务准确率要求不低于95%

8月18日,中国人工智能产业发展联盟第十八次全体会议上,中国信通院联合淘宝闪购正式发布《即时零售智能体可信基本要求》,围绕三大能力维度与六大安全领域构建评估体系,为即时零售AI Agent划定可量化的可信底线。这是即时零售领域首份针对AI Agent的系统性可信规范。

综合公开信息整理 2026-08-19 全文约 3 分钟读完
#即时零售 #AI Agent #可信规范 #中国信通院 #淘宝闪购
📜 首份 即时零售领域AI Agent系统性可信规范
95% 简单任务执行准确率要求
90% 复杂任务执行准确率要求

⚡ 30 秒速览

  • 规范是什么:《即时零售智能体可信基本要求》,由信通院与淘宝闪购联合牵头,蚂蚁、百度、阶跃星辰、MiniMax、同盾等共同参编。
  • 三大能力维度:功能完备性、执行准确性、执行效率性——覆盖智能体从"能做"到"做好"的全链路。
  • 六大安全领域:数据安全、访问安全、运行安全、漏洞管理、服务管理、科技伦理,贯穿全生命周期。
  • 量化底线:简单任务准确率≥95%,复杂任务≥90%,接口成功率≥99%,评测须分别构建不少于100道测试题。
  • 有温度的设计:面向老年群体等特定用户,规范要求智能体宜具备语音交互能力,让技术普惠落到实处。

01三个维度 + 六大领域 可信评估体系全貌

规范构建了一套覆盖智能体全生命周期的可信评估框架。技术侧聚焦三大能力维度,安全侧覆盖六大领域,二者共同构成评估体系的双支柱。

功能完备性

智能体能否完整理解并执行用户指令,不遗漏关键步骤

▶ 能力维度

执行准确性

任务执行结果与预期目标的吻合程度,误差在可接受范围内

▶ 能力维度

执行效率性

在合理时间内完成交付,响应速度与资源消耗达到平衡

▶ 能力维度

六大安全领域则构成可信底座:

数据安全全链路加密与合规
访问安全权限分级与控制
运行安全异常检测与容灾
漏洞管理定期扫描与修复
服务管理SLA与可观测性
科技伦理公平性与透明度

注:三大能力维度侧重智能体"能不能做好",六大安全领域侧重"是否可信赖"——两者结合构成完整的可信评估坐标系。

02数字划底线 可量化、可复现的评测基准

规范最受关注的部分,是给出了明确的量化指标。这些数字不是拍脑袋,而是基于即时零售场景中高约束、多意图、实时变化的用户需求推导而来。

≥95%简单任务准确率
≥90%复杂任务准确率
≥99%接口成功率
≥100道每类评测题量

注:简单任务指单步指令、无分支依赖的操作;复杂任务指多步推理、需调用外部工具或依赖前序结果的任务。接口成功率衡量智能体与外部系统交互的稳定性。

一个诚实的注脚:这些指标是底线而非天花板。规范的意义在于为行业建立"最低可信水位",企业可以在此基础上提出更高要求。

03从"能用"到"可信" 即时零售的独特挑战

即时零售场景中的AI Agent,面临的是高约束、多意图、实时变化的用户需求——用户要的不只是"推荐一个商品",而是"30分钟内送到、价格最优、且有货"。任何一个环节出错,体验都会归零。

传统智能体评估框架,解决不了这个问题。

传统评估框架

侧重模型能力(知识问答、推理测试),与实际交付场景脱节,缺少对任务执行全链路的验证。

即时零售可信规范

从"模型能做什么"转向"智能体能不能把事做完"——覆盖意图理解、工具调用、结果交付、异常兜底全流程。

中国信通院人工智能研究所安全治理部工程师郭苏敏在会议中表示:"该技术规范填补行业可信评估空白,为人工智能技术在即时零售领域应用筑牢安全底线。"

注:规范并非取代传统模型评测,而是在其之上叠加了一层面向交付场景的"可信层"——两者互补而非互斥。

04不只是冷冰冰的标准 一个"有温度"的案例

淘宝闪购科技法务负责人郝鹏在解读规范时提到一个细节:"AI普惠的理念也体现在了此次规范的编写中。"规范面向特定群体与民生场景,提出宜具备语音交互能力支持老年人便捷使用等内容。

即时零售智能体除了"能办事",还可以"有温度"。

🧓 老年人语音买药场景 适老化设计

  • 语音交互代替文字输入:老年人无需打字,直接说出"帮我买一盒降压药"即可启动任务流程。
  • 简化确认链路:系统自动匹配附近药店、比价、确认库存,用语音播报+大字体展示关键信息。
  • 异常兜底:如果某药品缺货,自动推荐等效替代方案并语音说明替换理由,避免用户陷入选择困境。
  • 紧急场景优先:识别"急用""马上要"等关键词,自动缩短配送时段,优先匹配最快运力。
规范要求:面向特定群体与民生场景,宜具备语音交互能力——技术普惠不是口号,而是写在规范里的硬性指引。

这个案例折射出规范的深层逻辑:可信不只是技术指标,还包括对不同用户群体的可及性。一个"可信"的智能体,应该让更多人用得起来、用得放心。

05为什么是现在? 政策与产业的双重驱动

规范的出台并非偶然。2026年上半年,从国家到地方层面,围绕智能体与即时零售的政策密集落地,为行业搭建了清晰的制度预期。

三条关键政策线,共同催生了这份规范。

2026年5月
三部委联合发文——国家网信办、国家发改委、工信部联合印发《智能体规范应用与创新发展实施意见》,明确提出"完善技术底座、构建标准协议"。
2026年6月
上海率先行动——上海市商务委员会等9部门联合印发《上海市支持即时零售高质量发展行动方案(2026—2028年)》,明确"深化AI+即时零售应用"。
2026年8月5日
淘宝闪购开放MCP能力——成为餐饮外卖领域首个开放该协议的平台,让AI能直连15大业务场景,为规范落地提供了真实测试场。
2026年8月18日
规范正式发布——在中国人工智能产业发展联盟第十八次全体会议上,首份即时零售智能体可信规范面世。

注:时间线显示,从国家政策到地方行动再到企业落地,整个链条在4个月内完成闭环——速度本身说明行业对可信标准的迫切需求。

参编单位的阵容也值得注意:蚂蚁、百度、阶跃星辰、MiniMax、同盾——既有互联网大厂,也有AI创业公司,还有安全科技企业。这种构成确保了规范既有前瞻性,又接地气

蚂蚁 百度 阶跃星辰 MiniMax 同盾 + 更多参编单位
编辑核心判断

可信规范的价值不在于"约束",而在于为整个行业建立了一个可量化的"信任起点"。当简单任务准确率95%成为基线,竞争就从"能不能做"转向"做得多好"——这恰恰是即时零售智能体从尝鲜走向规模化的关键一步。

规范已落地,场景已开放

淘宝闪购已开放MCP能力,AI可直连15大业务场景。规范全文可通过中国人工智能产业发展联盟渠道查阅,即时零售智能体可信评估同步启动。

中国人工智能产业发展联盟 → 查阅规范

* 规范文本及评测细则以官方发布版本为准