强化学习 + 语义停靠嵌入:arXivLabs 新框架让公交拥堵缓解率提升 37%
arXivLabs 团队提出一种基于强化学习与语义停靠嵌入的混合框架,在真实公交线网测试中,将公交拥堵(Bus Bunching)发生率降低 37%,平均到站准点率提升 22 个百分点,为城市交通调度提供了一种不依赖昂贵硬件的AI方案。
arXivLabs 团队提出一种基于强化学习与语义停靠嵌入的混合框架,在真实公交线网测试中,将公交拥堵(Bus Bunching)发生率降低 37%,平均到站准点率提升 22 个百分点,为城市交通调度提供了一种不依赖昂贵硬件的AI方案。
公交拥堵的根源是站点之间的“异质性”被忽略——市中心枢纽站与郊区末站的客流模式、路况敏感度完全不同。传统强化学习将站点视为离散 ID,模型无法泛化到未见过站点。
arXivLabs 框架的核心创新在于:为每个站点生成一个 64 维语义嵌入向量,编码三类信息:
注:64 维嵌入中,时空、客流、路况三类特征占比约为 37%、31%、31%,经消融实验验证,三类特征均贡献正向收益。
嵌入向量通过 对比学习 预训练,使得相似运营模式的站点在嵌入空间中彼此靠近。然后,这些嵌入作为强化学习 DQN 智能体的状态输入,指导智能体在每一站做出“是否延长停靠”或“调整发车间隔”的决策。
一个诚实的注脚:
语义嵌入的边际收益约为 2.3 个百分点,并非颠覆性突破。但其价值在于——它让模型具备了跨站点迁移能力,在一个区域训练的策略可以零样本迁移到另一个城市,这才是真正的工程红利。
注:柱形自 12% 起缩放,非零起点。拥堵率定义为“相邻两车到站间隔超过计划间隔 1.5 倍”的事件占比。RL + 语义嵌入相比纯 RL 降低 2.3 个百分点,相比规则调度降低 8.6 个百分点。
发车间隔固定,对实时客流和路况无响应。一旦某班次延误,后续班次逐渐聚集成“串”,形成拥堵。
智能体根据站点嵌入实时调整停靠时长,主动打破拥堵的“自增强循环”。语义嵌入让模型在高峰枢纽站更激进地延迟发车,在低峰站则快速通过。
arXivLabs 是一个协作框架,它聚合了来自交通工程、强化学习和自然语言处理三个领域的研究者。这种跨学科交叉正是解决公交拥堵这类“系统性问题”所需要的。
从技术路线上看,arXivLabs 团队走了一条低资源、高泛化的路线:
这套链路不需要昂贵的路侧单元、不需要车载计算平台,仅靠调度中心已有的历史数据即可完成预训练。部署时,只需将实时到站数据输入嵌入模型,即可输出调度指令。
这才是真正的工程落地思维——不追求模型的绝对精度,而是追求在真实约束下的可部署性。
语义嵌入的价值不在于提升多少百分点,而在于它让强化学习从“记住站点”进化为“理解站点”。这种泛化能力,才是 AI 从实验室走进城市交通系统的真正门票。
arXivLabs 已公开完整框架、实验配置与数据集,开发者可在 GitHub 上复现全部实验。
github.com/arXivLabs/bus-bunching-rl → 开源仓库