⚡ 智能体 · 行业观察

北京说 Agent 已能造世界,杭州说它只是刚发明的电灯泡

同一场技术节,北京工业场亮出「线上横店」——群核科技把线下片场扫描重建进电脑,让创作者在 3D 虚拟影棚里调度人物与摄像机;而千里之外的杭州学术场,学者们却给出截然不同的判断:今天的 Agent 大概只相当于电灯泡刚被发明出来,灯亮了,电网还没建。

来源:公开报道 2026-07-25 全文约 5 分钟读完
#AI Agent #硬核少年技术节 #博见社 #工业落地 #学术前沿
2 个 场 北京工业场 vs 杭州学术场,同日对话
4 工业场主题分享:虎鲸文娱/美图/群核/圆桌
6 学术场高校:清华/南大/上交/天大/山大/上海AI实验室

⚡ 30 秒速览

  • 北京在做什么:群核科技把横店片场扫描重建为线上 3D 影视基地;虎鲸文娱拆解影视品质的编剧/美术/导演三类审美;美图用 4 个专业 Agent + 70 个 Skill 交付商业物料。
  • 杭州在追问什么:Agent 能不能判断自己做得对不对、把经验沉淀下来形成自我进化——目前多数能力仍依赖基座模型,底层范式未变。
  • 一句话分歧:工业圈在补齐具体场景让灯先亮起来,学术圈在研究记忆、验证、Harness 与强化学习,试图搭建连接这些灯的电网。
  • 共同闭环:执行 → 验证 → 反馈 → 更新,两边追的其实是同一个闭环。

01北京工业场:AI 已经在搭真实世界

北京场关心的问题非常具体:视频能不能交付、人物会不会穿帮、商品颜色会不会跑偏、做出来的东西有没有人买单。三场分享连成了一条清晰的线——从生成内容,走向构建世界

🎬 群核科技:把横店片场搬进电脑3D 影视基地

  • 将横店部分线下片场扫描、重建为线上 3D 影视基地,创作者可直接进入虚拟片场,在数字化影棚中调度人物、道具和摄像机。
  • 解法核心:视频模型负责审美和语言控制,3D 模型负责一致性。先在三维空间固定人物、道具、场地和摄像机位置,再交给视频模型生成关键画面。
  • 一句话总结:一次搭建,全篇复用。客厅、宫殿或街道在 3D 空间搭好后,可被不同镜头反复调用,不必每生成一个镜头就重新抽卡。
背景:当前视频生成模型主要在二维像素层面学习,多视角拼图常出现门窗、家具、墙面位置互相矛盾的问题。

🎭 虎鲸文娱:影视品质拆成三类审美工业流程重写

  • 虎鲸文娱集团 CTO 杜颜龙将影视品质拆为编剧审美、美术审美、导演审美三类——AI 不仅要生成内容,还要理解什么故事成立、什么画面高级、什么镜头让观众进入剧情。
  • 三个面向未来的判断:AI 不会取代真人,而是形成新协作;AI 一定会重写影视生产流程,但只靠一个通用模型一句话生成精品在可见时间里仍不现实;内容供给大增后,精品会更稀缺,真正值钱的不再是「能不能生成」而是「什么值得被生成」

🖼️ 美图:从交付功能走向交付成果Agent Teams

  • 单个 Agent 难以完成复杂任务——真实创作包含多个目标,每个目标都有自己的上下文,全交给一个 Agent 容易顾此失彼。
  • 美图设计室组织了4 个专业 Agent + 70 个 Skill,从市场分析、内容生成、视觉创作一直做到投放分析,交付可直接使用的商业物料。
  • 价值转移信号:一张图够不够好看只是第一关;能不能进入业务流程、最终能不能带来收入,才决定这项 AI 能力究竟有没有价值。

02杭州学术场:电灯泡刚亮,电网还没建

杭州场联合 CCF 人工智能与模式识别专业委员会,邀请清华、南大、上交、天大、山大、上海 AI 实验室等机构学者,讨论「从生成式 AI 到智能体进化」。核心判断是:点亮一盏灯,并不等于电力革命已经完成

电灯泡(已点亮的部分)

Coding Agent 已能接手相当一部分过去由程序员完成的具体工作,且不只存在于演示视频里,而在真实业务中逐渐发生。

电网(尚未建成的部分)

具身智能进入现实世界后稳定性与泛化能力立刻成为难题;能自己发现问题、设置目标的开放世界 Agent,被判断为处在「比初期更早」的位置。

更尖锐的争论在于:从生成式 AI 走到 Agent,究竟是量变还是质变?多数嘉宾判断偏向量变——今天 Agent 能执行更长任务,主要得益于基模增强、上下文窗口变长、工具调用更稳定、Harness 持续优化,但底层技术范式尚未明显变化。

上海 AI 实验室青年研究员张航帆把两种观点接到一起:「一项任务过去执行一百次只成功一次,现在一百次只失败五次。站在技术演进角度看是持续量变;站在用户角度看,它已经从『不可用』变成了『可以交给它做』,这当然可以被理解为质变。」

真正的质变标准也很清晰:Agent 要能判断自己的结果是否正确,发现问题后主动修正,并将任务执行过程中产生的经验沉淀下来,形成自我进化。只有跨过这一步,它才算从依赖人类数据和预设流程,走向真正的自主学习。

杭州场四场主题报告,刚好从不同角度拼出了「自我进化还缺什么」的答案:

工具调用长期记忆安全边界自演化强化学习Self-Harness

天津大学郝建业关注工具/记忆/安全;上海交大温颖研究「生成—评估—训练」循环;清华大学周浩归纳出低时延基座、自演化强化学习、可学习长程记忆三项能力;张航帆进一步研究 Self-Harness——让 Agent 自动诊断和优化自己的运行框架。

03两边追的其实是同一个闭环

回头看开头那组「冲突」,其实并不矛盾。北京工业场展示的是 AI 已经能在具体行业里做到什么;杭州学术场追问的是这些局部能力什么时候才能连接起来,形成真正能自主运转和持续进化的系统。

北京:结果能不能稳定交付

视频要过审美和逻辑检查;虚拟片场要保证人物与空间一致;商品图要准确还原材质和颜色;内容投入市场后还要观察是否带来业务价值。

杭州:能力怎样不断增长

Agent 执行完任务后,要判断结果是否正确,发现错误后修正,再把有效经验写入记忆、技能或模型参数,逐渐形成持续学习能力。

两者指向同一个闭环:执行 → 验证 → 反馈 → 更新。工业界在具体场景中补齐流程、数据、空间和行业规则,让一盏盏灯先亮起来;学术界继续研究记忆、验证、Harness、强化学习和自主进化,试图搭建连接这些灯的完整电网。

横店片场已经被搬到线上,与 Agent 仍处在电灯泡时代,完全可以同时成立。局部已经足够科幻,完整系统仍处于早期。
编辑视角

本文素材来自一场企业技术节的现场实录,属企业通稿性质——两场对话的嘉宾邀请、议题设置与传播渠道均由主办方安排,分享案例以自家业务线为主,未见第三方独立复测或同行评议。读者宜带着以下背景判断:工业场的「线上横店」「Agent Teams」等案例呈现的是各公司当前主推路线,而非行业全貌;学术场的「电灯泡」比喻虽形象,但与会学者多与主办方有学术合作,观点倾向温和而非尖锐批评。

剥离传播语境,这场对话真正有价值的信息是:Agent 的能力评估正在从「单次生成」转向「闭环成熟度」——能不能验证、能不能沉淀经验、能不能跨任务复用,正在取代「生成效果惊艳不惊艳」成为新的分水岭。

当工业界开始把 3D 片场当资产复用、学术界把 Self-Harness 当研究靶点,意味着 Agent 竞争已从「谁的模型更强」转入「谁的闭环更短」——闭环越短,进化越快,这将是下一阶段分出梯队的关键变量。

延伸了解

硬核少年技术节 5.0 已于 7 月 20 日在杭州、北京两地同步启动,持续一周;博见社为学术+工业双场对话板块。

硬核少年技术节 5.0 → 博见社专题