全球首个无限时长视频生成智能体 vivago R1 实测:编排革命正在重新定义AI创作
2026年7月18日,智象未来在WAIC现场发布全球首个无限时长内容创作多模态智能体vivago R1,同步宣布近三个月累计完成超20亿元C轮融资。实测表明:一部1分11秒的"土耳其山寨星战"成片,人物、道具、场景一致性得分超95分,编排能力成为真正的胜负手。
2026年7月18日,智象未来在WAIC现场发布全球首个无限时长内容创作多模态智能体vivago R1,同步宣布近三个月累计完成超20亿元C轮融资。实测表明:一部1分11秒的"土耳其山寨星战"成片,人物、道具、场景一致性得分超95分,编排能力成为真正的胜负手。
2026年5月,智象未来在Product Hunt上发布了Vivago Video Agent,靠"AI导演"帮用户编角色、写叙事、做故事板,拿下当日产品榜第一。但那个版本单条视频封顶3分钟。
两个月后,vivago R1的目标是:无限时长。
当前行业主流AI视频产品仅支持15至30秒短镜头生成,谷歌Veo 3.1单段约8秒,多镜头拼到一两分钟,OpenAI Sora 2约60秒且消费端已关停,快手可灵3.0号称"导演级"能到两分钟。vivago R1直接打破这一天花板,支持长时长视频连续连贯生成,全面适配短剧、专题片、品牌宣传片等长周期创作场景。
单段15-30秒,多镜头拼接后最多2分钟,画面跳变、人设崩塌、叙事断层是常态。
无限时长,单段≤15秒但可无限拼接,通过"锁参考图+逐段参考图生视频"保持全片一致性。
vivago R1的核心优势概括为三个字:长、长、稳。第一个"长"指无限时长,第二个"长"指长任务推理能力——可自主完成精细化逻辑构思、镜头排布与风格校准,第三个"稳"指高稳定生成,内容有效可用成功率提升至85%左右,远高于行业平均水平。
很多人一听到"聚合别人的模型",就直觉认为没技术含量。但vivago R1的技术路线恰恰代表了行业共识:长视频生成的主流解法不是从零训一个能一口气生成十分钟的巨型模型,而是编排现有SOTA模型+跨镜头缝合。
vivago R1的架构可以拆成三层:
底层是智象未来自研的HiDream-O1系列(图像+视频),在第三方评测站被独立验证过;中间层聚合了Sora 2、可灵v2.6 Pro、Veo 3/3.1等业界最强视频模型;上层则是vivago R1真正的独家价值——Agent编排层,包含17个功能技能,覆盖视频、图像、电商、社媒等垂类,其中旗舰技能是cinematic-story-director。
用户在前端只看到"能力"(拍个电影故事/参考图生视频),看不到底层模型名。模型路由完全在服务端被技能层封装。这就像我们不会问水电来源于哪家公司,大部分用户需要的永远是某个能力,而不是模型本身。
为了验证vivago R1的真实能力,测试团队设计了一道"地狱级"考题:一部叶什尔查姆风格的荒诞科幻烂片——土耳其上世纪六七十年代的超低成本邪典片,精髓是"廉价,假得好笑"。这道题同时压上了人设一致性、道具一致性、风格一致性、跨场景长叙事,以及AI的"美化本能"与刻意廉价美学之间的博弈。
结果出乎意料:1分11秒,7个场景,从头到尾几乎不崩。
从Agent日志来看,短片走的是cinematic-story-director技能的完整流水线:Node0→Node9,先写成故事→改成剧本→拆成场景→定好美术风格→单独生成三张锁定参考图(阿里队长/外星后院/机器暴君)→每个镜头对着同一套参考图生成→最后缝合。每个分镜都用了10秒,单段≤15秒的限制被严格执行。
一部荒诞短片测的是"长片一致性+编排"这一面。但创作者在真实工作里会撞上的坑远不止这一个。以下三条每一条都对准一个具体场景,来把对vivago R1的认识补全。
"无厘头默剧短片,狗狗不能长出手脚,跨时间生成宠物形象要一致。"——生成结果中狗狗肢体没有出现任何漂移,哈士奇段落略微有些假,车厢烟花风格稍有不搭,但总体严格按照提示词执行。
"装在厨房吊柜下、把菜谱步骤投到料理台上、说一声'下一步'就翻页的投影模块。"——用不存在的产品测试,没有现成素材可抄。结果在复杂空间操作场景中表现稍逊,产品使用逻辑有少量偏差,但整体完成度依然很高。
"一口气把十二个星座场景全部生成,不用手动拼接。"——提示词中甚至没有枚举十二星座,规划阶段vivago R1真的全部生成并进了流程(还多出一个"隐藏星座")。多个场景自动串联,不需要用户手动拼接。
把镜头从vivago R1这一个产品拉回整个行业,会看到一个越来越确定的趋势:视频生成的模型能力正在变成基础设施。
两年前,谁的模型画得更清晰、更连贯就是绝对的胜负手。但到了2026年,第一梯队的画质差距在收窄,且大多开放了API——任何一个平台都能把这些最强模型接进来。模型本身越来越像一种随时能采购的原材料。
当原材料变成标准供应商品,稀缺性就会发生转移。
从"谁的模型更强"转移到"谁能把一堆模型编排成一个真正能干活、能交付的系统"。这正是vivago R1押注的地方——它不跟你比底层模型画得好不好,它跟你比从"我想拍条片"的念头到一条能直接发出去的成片之间,那段最脏、最累、最需要懂镜头语言和叙事的活,它替你干掉了多少。
这就像去超市买东西。可乐、伊利、金龙鱼在哪儿都有,货都一样。但人们还是喜欢往某一家跑,因为那家店帮你把品选好了、动线理顺了、该配的服务配齐了。买的不只是货,买的是"逛—选—买—用"打通的整条体验。聚合是手段,编排才是产品,最终体验才是兵家必争之地。
当模型能力变成可采购的原材料,真正的护城河不在参数规模,而在"从想法到成片"之间那段编排链路——谁能把脏活累活干得最干净、最稳定,谁就掌握了定义下一个内容平台的话语权。
vivago R1 已正式上线,登录官网选择「电影故事导演」技能即可体验无限时长视频创作。
vivago.ai → 开始创作