从“回答问题”到“把事办完”:飞猪V10的消费Agent工程化突围

消费Agent要实现从“回答问题”到“把事办完”的跨越,核心不在于无限提升模型推理能力,而在于构建一套“受约束的自主性”工程体系,用真实数据、工具规则与履约系统守住可执行底线。
Coding ✓ 已找到PMF
消费场景 ✗ 滞后
维度 Coding 消费场景
验证环境 相对封闭,代码能否运行、测试能否通过有明确判断标准 开放且主观,受价格、时间、位置、偏好等多元因素影响
商品状态 静态代码库,状态相对稳定 高度时间化,库存、价格、可售状态随时变动
任务生命周期 生成代码即完成核心任务 交易后还涉及值机、航变、退改等长尾履约环节
"
AI产品正在经历从大模型、Chat、Coding,到Agent、自进化,再到PhysicalAI的发展过程。当前行业主要关注点正进入Agent阶段,但消费Agent还没取得与Coding Agent类似的进展。
—— 陈烨 · 飞猪CTO
V10 AI能力矩阵
帮我想 灵感规划
帮我订 复杂筛选
帮我办 长程履约
AI Panel 场景覆盖
首页 酒店 机票 度假 订单
数据和商品必须“真实可达”
真正降低用户操作成本,不做GUI已擅长的
旧:强Workflow编排
固定步骤1 固定步骤2 固定步骤3
架构做减法,模型做加法
新:ReAct式AgentLoop
模型推理 动作选择 约束机制层
约束机制
轻量验证 + 离线拦截 短别名回填真实ID 白名单内选商品
Prompt 阶段一
早期
命令式写法,规定每步执行细节
演进
声明式写法,定义好行程目标与底线,让模型自主决定过程
机制 阶段二
早期
依赖人工流程兜底
演进
商品白名单、短别名、时空规则、数据沙箱,限制模型在不能出错处自由发挥
训练 阶段三
早期
通用预训练
演进
后训练内化知识,Reward Model覆盖信息真实性、偏好、时空合理性、完整性
LUI(能力上限)
精准·复杂·长尾需求 例:步行5分钟到迪士尼前门、允许宠物、适老
GUI(体验下限)
成熟·浏览·比较 例:多家酒店横向比价、价格+地图
中间态:LUI作为自然语言入口,控制GUI调整筛选条件,二者共存
“想、订、办”解决的是用户暂时不知道AI能做什么的问题,GUI解决的是并非所有结果都适合用对话呈现的问题。二者共同说明,AI Native是在模型能力、用户认知和交易效率之间寻找新的组合方式。
—— 飞猪产品团队 · 评测会分享
评测标准
核心指标:可用率
决定模型生成结果是否达到可以交给用户使用的标准,对应真实性与模型发挥之间的平衡选择。
标准确定 评测集筛选 多模型机器投票打分 人工抽样复核
对比对象 优势 劣势
其他OTA Agent 在线路规划、需求理解和内容表达方面具有一定优势 需持续提升真实供给的响应速度与覆盖率
通用大模型 强调“真实可达”,连接可下单商品供给,能完成预订及后续服务 回答的丰富性、联想能力和模型自由发挥程度存在不足
垂直应用不只是模型的下游,也可能成为新的训练环境。通用模型已学习大量互联网数据,未来牵引其发展的新问题和新反馈,将来自旅行等专业领域的真实业务环境反馈。

“Token类比为能源。相比互联网应用的快速扩张,能源进入各个行业需要更长时间。旅行等消费行业需要整理数据、建设评测环境、改造供应链,这个过程可能需要两年,或者不止,更可能是‘润物细无声’地逐渐渗透。”
—— 陈烨 · 飞猪CTO