🎬 多模态智能体 · 产品实测

全球首个无限时长视频生成智能体 vivago R1 实测:编排革命正在重新定义AI创作

2026年7月18日,智象未来在WAIC现场发布全球首个无限时长内容创作多模态智能体vivago R1,同步宣布近三个月累计完成超20亿元C轮融资。实测表明:一部1分11秒的"土耳其山寨星战"成片,人物、道具、场景一致性得分超95分,编排能力成为真正的胜负手。

综合公开信息整理 2026-07-22 全文约4分钟读完
#vivago R1 #智象未来 #AI视频生成 #多模态智能体 #无限时长
🎬 全球首个 无限时长视频生成多模态智能体
20亿+ 近三个月C轮累计融资
95/100 实测成片一致性评分

⚡ 30 秒速览

  • 产品定位:全球首个无限时长视频生成与编辑多模态智能体,核心卖点"长、长、稳"——无限时长、长任务思考、高稳定生成。
  • 技术路线:自研HiDream模型 + 聚合Sora 2/可灵/Veo等第三方模型 + 上层Agent编排,不是简单套壳,而是"自研+聚合+编排"混合架构。
  • 实测硬核:一部1分11秒的土耳其荒诞科幻片,7个场景无缝拼接,人物、道具、风格从头到尾不崩,仅41秒处有短暂画面发黏,整体完成度极高。
  • 深层信号:模型能力正在变成可采购的基础设施,编排层和长程一致性能力才是真正的护城河——谁铺平"想法到成片"的路,谁就掌握话语权。
  • 去哪体验:vivago.ai 官网,点选"电影故事导演"技能即可使用。

01从15秒到无限时长 vivago R1 到底改了什幺

2026年5月,智象未来在Product Hunt上发布了Vivago Video Agent,靠"AI导演"帮用户编角色、写叙事、做故事板,拿下当日产品榜第一。但那个版本单条视频封顶3分钟。

两个月后,vivago R1的目标是:无限时长。

当前行业主流AI视频产品仅支持15至30秒短镜头生成,谷歌Veo 3.1单段约8秒,多镜头拼到一两分钟,OpenAI Sora 2约60秒且消费端已关停,快手可灵3.0号称"导演级"能到两分钟。vivago R1直接打破这一天花板,支持长时长视频连续连贯生成,全面适配短剧、专题片、品牌宣传片等长周期创作场景。

传统AI视频

单段15-30秒,多镜头拼接后最多2分钟,画面跳变、人设崩塌、叙事断层是常态。

vivago R1

无限时长,单段≤15秒但可无限拼接,通过"锁参考图+逐段参考图生视频"保持全片一致性。

vivago R1的核心优势概括为三个字:长、长、稳。第一个"长"指无限时长,第二个"长"指长任务推理能力——可自主完成精细化逻辑构思、镜头排布与风格校准,第三个"稳"指高稳定生成,内容有效可用成功率提升至85%左右,远高于行业平均水平。

注:对比数据基于各产品官方公开信息及行业评测报告整理,截至2026年7月。vivago R1的"无限时长"指通过分段生成+拼接实现体验上的连续,并非单次推理生成任意时长。

02自研 + 聚合 + 编排 三层架构拆解

很多人一听到"聚合别人的模型",就直觉认为没技术含量。但vivago R1的技术路线恰恰代表了行业共识:长视频生成的主流解法不是从零训一个能一口气生成十分钟的巨型模型,而是编排现有SOTA模型+跨镜头缝合。

vivago R1的架构可以拆成三层:

自研模型层聚合模型层Agent编排层

底层是智象未来自研的HiDream-O1系列(图像+视频),在第三方评测站被独立验证过;中间层聚合了Sora 2、可灵v2.6 Pro、Veo 3/3.1等业界最强视频模型;上层则是vivago R1真正的独家价值——Agent编排层,包含17个功能技能,覆盖视频、图像、电商、社媒等垂类,其中旗舰技能是cinematic-story-director。

用户在前端只看到"能力"(拍个电影故事/参考图生视频),看不到底层模型名。模型路由完全在服务端被技能层封装。这就像我们不会问水电来源于哪家公司,大部分用户需要的永远是某个能力,而不是模型本身。

注:技术架构分析基于vivago官网llms.txt文件、第三方模型评测站数据及实测逆向分析。模型调用全在服务端完成,前端仅与vivago网关通信。

03土耳其星战片 一场"荒诞"的极限测试

为了验证vivago R1的真实能力,测试团队设计了一道"地狱级"考题:一部叶什尔查姆风格的荒诞科幻烂片——土耳其上世纪六七十年代的超低成本邪典片,精髓是"廉价,假得好笑"。这道题同时压上了人设一致性、道具一致性、风格一致性、跨场景长叙事,以及AI的"美化本能"与刻意廉价美学之间的博弈。

结果出乎意料:1分11秒,7个场景,从头到尾几乎不崩。

🎬 土耳其星战:叶什尔查姆风格荒诞科幻片 一致性 95/100

  • 人物锁定:八字胡红紧身衣的"阿里队长"、漏勺当头盔的纸板怪兽,从头到尾形象统一,没有出现常见的"AI脸"漂移。
  • 廉价美学守住了:AI没有"忍不住"把纸板怪兽偷偷渲染成光滑的CGI机器人,风格指令被严格执行。
  • 7个场景无缝拼接:从外星后院到机器暴君巢穴,场景切换自然,叙事连贯。
  • 唯一瑕疵:41秒处有约3-4秒画面发黏,风格与前后略有脱节;1分钟处背景从"天台"悄悄漂到"影棚",需回放多次才能发现。
实测结论:完成度极高,在今天的AI视频领域属于第一梯队。一致性靠的是"锁参考图+逐段参考图生视频"的工程编排,而非模型的长程记忆。

从Agent日志来看,短片走的是cinematic-story-director技能的完整流水线:Node0→Node9,先写成故事→改成剧本→拆成场景→定好美术风格→单独生成三张锁定参考图(阿里队长/外星后院/机器暴君)→每个镜头对着同一套参考图生成→最后缝合。每个分镜都用了10秒,单段≤15秒的限制被严格执行。

注:测试过程基于vivago R1的cinematic-story-director技能,日志显示共7个分镜、Node9执行拼接。41秒处的画面偏移可能是某一段模型输出质量波动导致。

04三个方向补全认知 形象可控 · 理解力 · 批量生产

一部荒诞短片测的是"长片一致性+编排"这一面。但创作者在真实工作里会撞上的坑远不止这一个。以下三条每一条都对准一个具体场景,来把对vivago R1的认识补全。

🐕

狗狗特工队 · 形象可控

"无厘头默剧短片,狗狗不能长出手脚,跨时间生成宠物形象要一致。"——生成结果中狗狗肢体没有出现任何漂移,哈士奇段落略微有些假,车厢烟花风格稍有不搭,但总体严格按照提示词执行。

📟

一个不存在的产品 · 理解力

"装在厨房吊柜下、把菜谱步骤投到料理台上、说一声'下一步'就翻页的投影模块。"——用不存在的产品测试,没有现成素材可抄。结果在复杂空间操作场景中表现稍逊,产品使用逻辑有少量偏差,但整体完成度依然很高。

十二星座安全屋 · 批量生产

"一口气把十二个星座场景全部生成,不用手动拼接。"——提示词中甚至没有枚举十二星座,规划阶段vivago R1真的全部生成并进了流程(还多出一个"隐藏星座")。多个场景自动串联,不需要用户手动拼接。

注:三个场景均为独立测试,分别验证形象可控性、产品理解力、批量生产能力。测试结果受提示词质量影响,经过良好打磨的提示词可进一步提升输出质量。

05模型即水电,编排即产品

把镜头从vivago R1这一个产品拉回整个行业,会看到一个越来越确定的趋势:视频生成的模型能力正在变成基础设施。

两年前,谁的模型画得更清晰、更连贯就是绝对的胜负手。但到了2026年,第一梯队的画质差距在收窄,且大多开放了API——任何一个平台都能把这些最强模型接进来。模型本身越来越像一种随时能采购的原材料。

当原材料变成标准供应商品,稀缺性就会发生转移。

从"谁的模型更强"转移到"谁能把一堆模型编排成一个真正能干活、能交付的系统"。这正是vivago R1押注的地方——它不跟你比底层模型画得好不好,它跟你比从"我想拍条片"的念头到一条能直接发出去的成片之间,那段最脏、最累、最需要懂镜头语言和叙事的活,它替你干掉了多少。

这就像去超市买东西。可乐、伊利、金龙鱼在哪儿都有,货都一样。但人们还是喜欢往某一家跑,因为那家店帮你把品选好了、动线理顺了、该配的服务配齐了。买的不只是货,买的是"逛—选—买—用"打通的整条体验。聚合是手段,编排才是产品,最终体验才是兵家必争之地。

编辑核心判断

当模型能力变成可采购的原材料,真正的护城河不在参数规模,而在"从想法到成片"之间那段编排链路——谁能把脏活累活干得最干净、最稳定,谁就掌握了定义下一个内容平台的话语权。

现在就能用

vivago R1 已正式上线,登录官网选择「电影故事导演」技能即可体验无限时长视频创作。

vivago.ai → 开始创作