从“回答问题”到“把事办完”:飞猪V10的消费Agent工程化突围
消费Agent要实现从“回答问题”到“把事办完”的跨越,核心不在于无限提升模型推理能力,而在于构建一套“受约束的自主性”工程体系,用真实数据、工具规则与履约系统守住可执行底线。
Coding
✓ 已找到PMF
消费场景
✗ 滞后
| 维度 |
Coding |
消费场景 |
| 验证环境 |
相对封闭,代码能否运行、测试能否通过有明确判断标准 |
开放且主观,受价格、时间、位置、偏好等多元因素影响 |
| 商品状态 |
静态代码库,状态相对稳定 |
高度时间化,库存、价格、可售状态随时变动 |
| 任务生命周期 |
生成代码即完成核心任务 |
交易后还涉及值机、航变、退改等长尾履约环节 |
"
AI产品正在经历从大模型、Chat、Coding,到Agent、自进化,再到PhysicalAI的发展过程。当前行业主要关注点正进入Agent阶段,但消费Agent还没取得与Coding Agent类似的进展。
—— 陈烨 · 飞猪CTO
V10 AI能力矩阵
帮我想
灵感规划
帮我订
复杂筛选
帮我办
长程履约
AI Panel 场景覆盖
首页
酒店
机票
度假
订单
✓
数据和商品必须“真实可达”
✓
真正降低用户操作成本,不做GUI已擅长的
旧:强Workflow编排
固定步骤1
→
固定步骤2
→
固定步骤3
架构做减法,模型做加法
新:ReAct式AgentLoop
模型推理
↻
动作选择
→
约束机制层
约束机制
轻量验证 + 离线拦截
短别名回填真实ID
白名单内选商品
演进
声明式写法,定义好行程目标与底线,让模型自主决定过程
演进
商品白名单、短别名、时空规则、数据沙箱,限制模型在不能出错处自由发挥
演进
后训练内化知识,Reward Model覆盖信息真实性、偏好、时空合理性、完整性
LUI(能力上限)
精准·复杂·长尾需求
例:步行5分钟到迪士尼前门、允许宠物、适老
GUI(体验下限)
成熟·浏览·比较
例:多家酒店横向比价、价格+地图
中间态:LUI作为自然语言入口,控制GUI调整筛选条件,二者共存
“想、订、办”解决的是用户暂时不知道AI能做什么的问题,GUI解决的是并非所有结果都适合用对话呈现的问题。二者共同说明,AI Native是在模型能力、用户认知和交易效率之间寻找新的组合方式。
—— 飞猪产品团队 · 评测会分享
评测标准
核心指标:可用率
决定模型生成结果是否达到可以交给用户使用的标准,对应真实性与模型发挥之间的平衡选择。
标准确定
→
评测集筛选
→
多模型机器投票打分
→
人工抽样复核
| 对比对象 |
优势 |
劣势 |
| 其他OTA Agent |
在线路规划、需求理解和内容表达方面具有一定优势 |
需持续提升真实供给的响应速度与覆盖率 |
| 通用大模型 |
强调“真实可达”,连接可下单商品供给,能完成预订及后续服务 |
回答的丰富性、联想能力和模型自由发挥程度存在不足 |
垂直应用不只是模型的下游,也可能成为新的训练环境。通用模型已学习大量互联网数据,未来牵引其发展的新问题和新反馈,将来自旅行等专业领域的真实业务环境反馈。
“Token类比为能源。相比互联网应用的快速扩张,能源进入各个行业需要更长时间。旅行等消费行业需要整理数据、建设评测环境、改造供应链,这个过程可能需要两年,或者不止,更可能是‘润物细无声’地逐渐渗透。”
—— 陈烨 · 飞猪CTO