🏭 WAIC 2026 · 对话蚂蚁数科
蚂蚁数科的「智能体超级工厂」:近 200 个数字专家上岗,还要立一套中国行业版 Harness
7 月 17 日,2026 世界人工智能大会(WAIC)在上海开幕。首日,蚂蚁数科副总裁、中国区业务发展部总经理孙磊在公开访谈中详解「商业智能体超级工厂」 :承载平台 Agentar 2.0 首批预置近 200 个岗位级数字专家模板,并立下「价值交付、效果付费」 的交付承诺。为什么重要:企业级 AI 的赛点正从模型能力转向交付体系,蚂蚁试图把金融级合规、行业垂直大模型与工程化方法论,打包成可复制的标准化商品。
来源:公开报道 •
2026-07-23 •
对话时间:2026-07-17 •
约 3 分钟读完
#蚂蚁数科
#Agentar 2.0
#商业智能体
#行业Harness
#效果付费
近 200 个
岗位级数字专家模板 · Agentar 2.0 首批预置
90–95%
专业场景回答准确率(企业自报口径)
85%+
「胜合率」:与专业人员回答的一致程度
⚡ 30 秒速览
工厂里有什么: Agentar 2.0 预置近 200 个岗位级数字专家模板 + 数百个可订阅的 Skills 级工具,企业按岗位开箱即用,大企业与中小企业用同一套能力。
差异化打法: 行业化(垂直大模型)、场景化(工程化可复制)、生态化(组件 API 化)——孙磊称其是与通用方案的三大区别。
金融三张门票: 安全合规("宁愿不做,也不能犯错")、垂直大模型压幻觉、效果可验证;自报专业场景准确率 90–95%、胜合率 85%+。
标准野心: 将海外 Harness 概念本土化为「中国行业版」——金融场景已跑通「意图识别→策划→执行→表达」四车间,下一步向能源、医疗复制并逐步开放。
读前须知: 全文为企业高管专访,所有数字均为单方口径、未经第三方核验,「效果付费」暂无计费细则——请配合文末「编辑视角」服用。
01 「超级工厂」在造什么 三个变化 × 三化路线
孙磊判断,过去一年 AI 行业发生了三个根本性变化——这是"超级工厂"立论的基础:
通用问答式 AI → 能完成任务、解决问题的智能体
通用场景 → 垂直行业的核心业务问题
个人效率提升 → 团队与业务间的组织级协同进化
围绕这些变化,蚂蚁数科把集团的垂直大模型能力、行业场景经验与 20 多年技术积累 沉淀为标准化产品:Agentar 2.0 首批预置近 200 个岗位级数字专家模板、数百个可订阅的 Skills 级开箱工具。企业按岗位与经营需求快速启用,无需从零起步 ,中小企业也能获得"与蚂蚁集团类似的技术能力和产品能力"。
与通用方案的差异,他归结为「三化」:
① 行业化
行业数据 × 垂直大模型。"只有通用大模型,没有行业数据和专业能力支撑,无法真正解决专业度和业务适配。"
② 场景化
把业务语言翻译成技术能力,将金融、医疗、能源等领域的实践工程化,形成可复制的解决方案。
③ 生态化
相关组件 API 化、简单化,让合作伙伴快速接入,围绕自身行业优势进行创新。
"真正决定企业级 AI 落地效果的,不只是模型能力本身,更是行业理解、工程化能力与价值交付体系的持续建设。"
—— 引自 行业媒体报道原文
02 金融这道窄门:三道坎、两个数 「宁愿不做,也不能犯错」
金融是蚂蚁数科的老本行,也是对安全、合规、稳定性要求最苛刻的行业。孙磊把金融机构拥抱 Agent 的顾虑拆成三道坎 ,并逐一给出解法:
🛡️ 坎① 安全与合规
金融涉及监管红线,AI 应用必须符合监管与国家要求;没有安全能力和风险控制体系,AI 很难真正落地金融场景。
蚂蚁的解法: 依托支付、财富管理、保险等自有金融场景,长期历练合规与风控能力。
🎯 坎② 专业度与幻觉
金融业务高度专业,模型必须准确理解并回答专业问题,不能"泛泛回答其他金融问题"。
蚂蚁的解法: 行业垂直大模型 + 业务场景工程化能力,"两个能力相结合,才能更加贴合实际场景"。
📈 坎③ 效果验证(ROI)
金融机构过去在信息化、数字化上投入巨大,AI 转型必须回答"投入之后如何体现价值"。
蚂蚁的解法: 提出「价值交付、效果付费」,先用两个维度验证智能体是否真具备专业能力 ↓
90–95%+ 回答准确率 · 例:用户咨询保险,就准确答保险,而非泛聊其他金融话题
85%+ 胜合率 · 专业人员与智能体同题作答的一致程度,用于财富、保险、基金场景
注:两个数字均为孙磊在采访中披露的企业自测口径,评测集、样本量与打分方法未公开,亦无第三方核验。
「宁愿不做,也不能犯错。」
—— 孙磊谈金融级 AI 的安全底线
模式核心 · 效果付费
先证明价值,再按效果收费——营销场景看转化效率是否提升,风控场景看风险是否降低。
03 中国行业版 Harness 从"三车间"到"四车间"
Harness 是海外提出的工程化概念,本质是"如何把模型能力工程化落地" 。孙磊直言,打造符合中国行业特点的行业版 Harness,正是超级工厂的重要壁垒。在金融场景,蚂蚁已把原有的"三车间"升级为"四车间" :
① 意图识别 → ② 策划 → ③ 执行 → ④ 表达
🧭 为什么"意图识别"排第一: 用户问的是"保险",真实需求可能是资产配置、财富管理或产品组合推荐——先读懂真实意图,再完成后续服务。而不同行业(能源、医疗等)需要不同颗粒度的流程设计,这正是行业版 Harness 要沉淀的东西。
走出金融,跨行业复制还要补上三块拼图 :
数据治理是地基: 以自身外部数据能力融合企业内部业务数据,训出行业垂直模型;制造、医疗、工业的数据基础远比金融复杂,工厂内置数据治理工具帮企业补基础。
安全能力分行业适配: 金融盯监管合规、制造盯生产安全、能源盯预测准确——光伏场景已用时序大模型结合天气与现场情况做发电量预测。
效果验证分行业推进: 金融、医疗的价值验证体系较成熟,其他行业仍在与合作伙伴共建评估标准。
💰 金融
🏥 医疗
⚡ 能源
🚗 出行
🚄 交通
✈️ 航空
注:以上为孙磊口径中"已积累能力"的领域;各行业成熟度不一,金融最完整,其余多在共建阶段。
04 未来 6–12 个月 孙磊给出的三个看点
🧩
智能体矩阵扩容
擅长、有数据积累的领域(金融、医疗、能源、出行等)进一步标准化产品输出 ;其余行业与合作伙伴共建行业垂直大模型和智能体。
🔓
行业版 Harness 开放
梳理各行业工程化能力、形成标准化方法论;金融"四车间"已成型,能源、医疗等行业版 Harness 将与生态伙伴共探,并逐步开放相关能力 。
📏
评测体系加码
在某头部城商行项目中已进行 28 轮评测 ;持续更新评测体系,用"更科学的方式"验证价值交付、效果付费,平台与工具能力也将持续发布。
✍️ 编辑视角 · 信源提示
这是企业专访,不是第三方测评。 全文来自 行业媒体直播间对蚂蚁数科副总裁孙磊的对话,属企业单方表达:90–95% 准确率、85%+ 胜合率、28 轮评测等关键数字均为自报口径,评测集、样本量与打分方法未公开;唯一提到的客户是"某头部城商行",无法查证。请把它当作蚂蚁数科的 To B 战略路线图来读,而非经审计的成绩单。
「效果付费」值得追踪,但先别急着当真。 它精准击中企业 AI"重投入、难验证"的痛点,若兑现将改写 To B AI 的收费逻辑;但计费方式、未达标如何处理,原文只字未提。建议存档此承诺,等第一批可核验的落地案例再打分。
我们的判断: "从卷模型到卷交付"是真实的行业转向,蚂蚁的硬筹码是金融级合规经验与支付级工程积累;真正的硬仗在跨行业复制——制造、医疗的数据地基远比金融复杂,这一点他们自己也没有回避。
▶ 读者行动清单
原文未附体验入口。Agentar 2.0 面向企业提供服务,可通过蚂蚁数科官方渠道咨询模板订阅与合作;WAIC 之后行业版 Harness 的开放进展值得蹲守。若你正在评估行业智能体,采购前建议向厂商索要三样东西:
评测方法与数据集说明 ——准确率、胜合率究竟是怎么测出来的;
可具名、可回访的客户案例 ——而非"某头部机构";
「效果付费」的计费细则与未达标条款 ——口号落到合同里才算数。
来源:公开报道 专访 · 报道发布于 2026-07-23 · 对话时间 2026-07-17(WAIC 上海现场)
本页为编辑重制快讯,所有数据与引语均引自原始报道;其中企业自测数据未经第三方核验,口径以官方披露为准