🔭 IJCAI 2026 前瞻 · 智能系统

大模型之后,中国 AI 的竞争正在转向“系统能力”

7 月,IJCAI 2026 在德国不来梅召开。议程里最显眼的关键词不是某个新模型,而是 Agent、Multi-agent、Robotics、Reinforcement Learning——它们正在被大模型重新激活。中国厂商的竞争焦点,也正从“谁的模型更强”,转向“谁能把模型放进复杂系统”

来源:综合公开信息整理 2026-07 全文约 5 分钟读完
#IJCAI2026 #多智能体 #Agent #系统能力 #大模型工程
40 Minsky 提出“智能源于多智能体协作”至今
11 中国企业与学术机构在文中明确布局
3 IJCAI 2026 重要奖项指向同一方向

注:统计范围为本文所引公开信息中明确提及的机构与奖项;数字用于快速建立认知,不代表完整名录。

⚡ 30 秒速览

  • 主线:IJCAI 2026 在不来梅召开,Agent、多智能体、机器人、强化学习占据议程核心;中国厂商的竞争焦点,正从“参数”转向“系统”。
  • 两条路线:阿里/字节从模型向外长——造技能、攒经验;百度/腾讯/华为向内收——把模型嵌回地图、搜索、知识与业务系统。
  • 奖项佐证:三项重要奖项分别颁给多智能体协调、机制设计与物理智能方向,评委用奖项投了票。
  • 冷静声音:复旦警示“奖励攻击”放大约束偏差;清华押注“有限监督下的可扩展智能”;字节提示高质量行动数据才是下一个瓶颈。
  • 编辑判断:模型正在成为底座;下一场竞争的蛋糕,在模型之外。

01不来梅会场里最醒目的关键词

如果观察今年大会的议程结构和重点活动,Agent、Multi-agent、Robotics、Reinforcement Learning 几个词的曝光率,会明显高于任何一家大模型公司的名字。这本身就是一条新闻。

但这些关键词,并不是大模型时代才出现的新问题。

规划、决策、多智能体协作、机器人控制——这些研究最短的也有几十年传统。过去它们分属不同领域,各有各的算法、数据集和评价体系;今天,一个拥有强大语言理解与推理能力的大模型,正在进入这些系统,充当重新组织它们的中介。

这正是观察中国 AI 产业的一个窗口:当模型能力趋同,谁有能力把它放进足够复杂的系统里?

AgentMulti-agentRoboticsReinforcement LearningPlanningTool UseComputer UseNeuro-symbolic AIPhysical AI

注:以上为编辑对原文高频议题的提取,词语之间无排序关系。

02奖项是证据:评委把票投给了什么

判断一场顶级会议的走向,看奖项归属比看宣传稿可靠得多。今年的获奖名单,指向性非常强。

RESEARCH EXCELLENCE AWARD · 多智能体协调

Nicholas Jennings

获奖演讲:《The Past, Present and Future of Agentic AI》

表彰他在 multi-agent coordination、human-agent teamwork 与 autonomous agents 方面的开创性工作。他在演讲中给出的判断是:Agent 的下一阶段,不是把单个 Agent 做得更强,而是合作、协调、谈判与集体决策。

JOHN MCCARTHY AWARD · 机制设计

David Parkes

AI 与经济学交叉领域

表彰他在机制设计上的贡献,尤其关注多智能体环境中的效率、公平与激励一致性——当多个 Agent 在同一系统里博弈,规则设计就是底层能力。

COMPUTERS AND THOUGHT AWARD · 物理智能

Jiajun Wu

主题:Building Visual and Physical Intelligence Through Code

研究焦点在计算机视觉、生成式 AI 与机器人智能的结合。它代表的是一条更长的链路:从理解世界,到在世界中采取行动。

三个奖项,三个方向——多智能体、机制设计、物理智能。它们共享同一个判断:AI 的评价标准,正在从“答得对”转向“做得到”。

注:奖项信息依据 IJCAI 2026 官方公布信息整理,获奖人及研究贡献为公开信息。

03中国厂商的两条进路:向外长技能,向内装系统

产业界的动作与学术风向,落在同一个判断上。过去两年国内 AI 最激烈的竞争是“谁的模型更强”;到了今年,真正值得观察的是:谁能把模型放进足够复杂的系统。

向外 · 长出技能与经验

模型 → 拆解 → 训练 → 复用。重点在 Agent 的能力供给与经验来源。

向内 · 装回业务系统

模型 → 嵌入 → 调用 → 闭环。重点在数据、知识与真实世界的反馈。

注:两条路线为编辑基于公开信息的归纳,不代表公司官方分类。

路线 A · 造技能 阿里
  • Qwen-CUA:把模型推进到 Computer Use 阶段——观察屏幕、操作鼠标和键盘完成任务,不再依赖网页结构或专用接口。
  • Qwen DianJin:面向金融 Agent,把能力拆解为 Process Reward Model、工具调用和 Skill Library;其中 Fin-PRM 已被 IJCAI 2026 接收。
  • 工程思路:大模型不能只是一个黑盒,而要被拆解、评价、训练与复用——这本质是在给 Agent 建立一套“技能体系”。
路线 B · 攒经验 字节
  • ByteDance Seed 团队的 GUI-ReWalk,研究如何大规模生成 GUI Agent 的训练轨迹。
  • 通过随机探索、意图推理、反思和错误恢复,让 Agent 获得更多真实操作经验
  • 关键判断:未来限制 Agent 能力的不只是模型规模,而是高质量行动数据从哪里来
路线 C · 装系统 百度 · 腾讯 · 华为
  • 百度 MapAgent:把视觉模型、约束推理、Planner、工具调用与结果验证组合进地图生产流程;同时把地点检索、路线规划、实时路况封装成可被 AI 调用的服务。
  • 腾讯:推荐、搜索、用户关系、图学习不会被大模型替代,反而会被重新吸收——产品级 Agent 需要理解用户、预测需求、连接信息并实时决策。
  • 华为:组织聚焦知识图谱、Agent 记忆、规划、工具使用与多智能体协调的工作坊,核心问题是国产模型、算力、终端与工业场景如何形成完整闭环

阿里在解决 Agent 会什么,字节在探索 Agent 怎么学会,百度们在搭建 Agent 在哪干活——三条路彼此咬合,缺一条都跑不远。

04风险与瓶颈:连续行动的代价

当 Agent 从“回答一个问题”走向连续行动,错误的代价不再是刷新一次网页。今年大会上,几道“冷静”的声音格外值得听。

奖励攻击复旦 · 《Reward Hacking in the Era of Large Models》

当模型通过奖励机制学习行动策略时,可能只优化指标、偏离真实目标。在金融交易、代码开发或物流调度中连续行动,错误的奖励信号会带来更复杂的问题。

数据瓶颈字节 GUI-ReWalk 背后的追问

大模型之后,限制 Agent 的不再只是参数规模,而是高质量行动数据从哪里来。随机探索、意图推理、反思与错误恢复,是补齐这一环的尝试。

监督不足清华 Tutorial · Scalable Intelligence under Limited Supervision

模型能力提升不一定只靠更多数据和更大算力,还需要交互、经验复用和自适应学习——这在方法论上直接呼应产业界的 Agent 技能积累。

聊天机器人答错,刷新一下就好;Agent 做错一步,可能已经完成了下单、转账或变更线上配置。

05为什么是现在:一场 40 年的思想实验成为主线

“纳须弥于芥子”——在极小的种子里,容纳巨大的世界。这句话常被用来形容某种不可思议的容纳力,也是理解今年大会的一条暗线。

1986 年,Marvin Minsky 在《The Society of Mind》里写下过一个后来影响深远的想法:“智能”不一定来自某一个全知的大脑,而可能来自许多 agents,通过分工、连接与协作共同产生。

四十年后,大模型拥有了工具调用、记忆、视觉理解与行动能力。

产业热词从“涌现”变成“Agent”,从“对齐”走向“Computer Use”。但技术真正面对的问题没有变:当一个模型需要规划任务、调用工具、获得反馈、调整策略,它始终要回答那个并不新鲜的问题——下一步做什么。

reasoning planning tool use environment interaction reward

注:链条为编辑对原文思路的递进关系归纳,箭头表示能力向前延伸的方向。

2025 年,DeepSeek 把国内产业的注意力推向了 reasoning、RL 和 test-time compute。但“让模型想得更久”只是起点。从 reasoning 到 planning,从 planning 到 tool use,从 tool use 到 environment interaction,再到 reward——这条链条的终点,不是更大的模型,而是更完整的系统。

当行动从数字世界延伸到现实世界,就轮到 Physical AI 登场。感知、规划、控制、决策,这些机器人领域的旧问题,因为大模型提供的一层语义理解与任务分解能力,重新被点燃。

Judea Pearl 一直提醒我们区分 prediction 与 intervention——预测世界只是智能的一部分;真正的智能系统,还要理解行动带来的后果。

当模型开始调用工具、制定计划、操作电脑甚至控制机器人,它面对的已经不是语言生成问题,而是现实世界中的连续决策问题。Agent 时代真正要回答的,就是那个老问题:接下来应该做什么?

模型越来越像底座。竞争,正在向模型之外扩散。

编辑核心判断

参数竞赛的边际收益正在快速收窄。接下来真正的分水岭是“系统能力”——高质量行动数据、真实业务反馈闭环与工具生态的工程整合。谁能踩着这些台阶把 Agent 送进现实世界,谁就拿到下一张门票。

怎么跟进

IJCAI 2026 官方议程与论文列表已公开。建议重点追踪 Agent、Multi-agent、Robotics、Reinforcement Learning 四条主线,以及“有限监督”“奖励攻击”这几类冷静议题——它们往往预告下一个冬天的话题。

前往大会官网查看完整议程