
作者丨Rhea
编辑丨马晓宁 李娜
7月18日,在2026世界人工智能大会(WAIC)现场,智象未来正式发布全球首个无限时长内容创作多模态智能体vivago R1,随后,智象官宣已经完成了 C 轮融资,在近三个月完成超 20 亿元人民币的融资。

01
2026 年 6 月 23 日,伯克利哈斯商学院官网发过一篇专栏评论 Insight 文章,作者 Akash Rathi 是谷歌 Pixel 的产品经理,里面提到一个关键的判断和论点(作者表示仅代表个人不代表谷歌):
模型和编排框架都在商品化;
纯软件的 Agent,包括编排层恰恰是护城河最弱的,类似"几周就能被克隆""一键导入就能搬走"的质疑一直存在
所以护城河从大脑(模型)迁移到 Physical Experience(物理体验)

图注:《The AI Moat Is Migrating – And Most Leaders Are Looking in the Wrong Place》
另一边在资本市场上,Cursor 在 2026-06 被 SpaceX 以 600 亿美元收购,之前 Manus 差点以 20 亿美金收购,最近 OpenRouter 也在和多家科技巨头谈收购机会。而就在几天前,智象未来刚宣布完成 15 亿元 C 轮融资,近三个月累计融资超 21 亿元,正式跻身独角兽行列。
Manus 已经证实了聚合是手段,编排出来的体验才是人们真正需要的产品。现在面对这大把的开源模型,谁都能做微调,但是看着用户需求在自己的沙箱里一步步完成的成就感才是产品人最 aha 的时刻。所以在面对平台型的 AI 产品时,我们更应该关注的是在人人都能聚合的前提下,它在上面多做的那层 Agent 编排,有没有做出别人做不出的、能验证的东西 。
这个问题的区别就是我们做这个测评的核心。想清楚了就知道 vivago R1 这类产品该怎么看;想不清楚,就会永远卡在又一个套壳的条件反射里,既高估了它也低估了它。vivago R1 只是这个更大问题的一个切片。这款产品于 2026 年 WAIC 大会期间刚刚发布,号称全球首个具备无限时长视频生成与编辑能力的多模态创作智能体,核心卖点是“长、长、稳”——无限时长、长任务思考、高稳定生成,也正是这次实测要验证的东西。

vivago.ai 官网

02
vivago的母公司是智象未来(HiDream.ai),2023 年 3 月成立在北京,创始人兼 CEO 是梅涛。这个名字在计算机视觉圈不算陌生,他之前是微软亚洲研究院的高级研究员,后来是京东的高级副总裁,2025 年当选 ACM Fellow。
智象未来的定位是「全球唯一同时支持文本、图像、视频、3D 四个模态的基础模型厂商」,此前开源过文生图模型 HiDream-I1。vivago 是智象面向专业创作者的那个智能体平台。

vivago R1 是目前最新的模型
但要理解 vivago R1 到底新在哪,也许得看看它的前身——就在两个月前,2026 年 5 月,智象在 Product Hunt 上发过一个叫 Vivago Video Agent 的产品,靠一群 AI 导演帮你编角色、写叙事、做故事板,还能在渲染前先看关键帧。当时它拿了当日产品榜第一。但那个版本的输出时长封顶就是3分钟,无法再长了。

Vivago Video Agent 评测:R1 的前身五个月前登上 Product Hunt 当日第一,当时单条视频还封顶在 3分钟
两个月后,vivago R1 的目标是做到 无限时长 视频创作。
这是全球首个具备无限时长视频生成与编辑能力的多模态创作智能体,标志着AI在创意生产领域的一次范式转移:从辅助生成单点素材,进化为能够自主规划、调度并完成长链路创作任务的“智能搭子”。vivago R1的核心优势可以概括为“长、长、稳”三大特质,精准回应了行业长期存在的时长受限、逻辑混乱、效果不稳三大痛点:
▎一是无限时长,全场景无限制适配。
当前行业主流AI视频产品仅支持15-30秒短镜头生成,vivago R1彻底打破行业时长壁垒,支持长时长视频连续、连贯生成,全面适配短剧、专题片、品牌宣传片、影视成片等不同品类长周期创作场景,填补了行业长视频创作的市场空白。
▎二是长任务思考,保障创作逻辑连贯统一。
vivago R1 具备长任务推理能力,可自主完成精细化逻辑构思、镜头排布与风格校准等,有效解决AI生成视频的画面跳变、人设崩塌、叙事断层、风格割裂的行业难题,保障全片创作的完整性与专业性。
▎三是高稳定生成,赋能商业规模化交付。
依托 AgentOS 全流程调度与治理能力,vivago R1 实现创作全链路可控可校准,将内容有效可用成功率提升至85% 左右,远高于行业平均水平,极大降低反复修改调试的时间与人力成本,生成内容可直接应用于商业制作、品牌传播与市场化交付。

03
▎第一,编排是这条赛道的正路,不是偷懒。
很多人一听 它自己编排别人的模型 ,就觉得没技术含量。但这恰恰是长视频生成领域现在的主流解法。2026 年有一批做长片生成的论文,比如那套 ScripterAgent 写脚本、DirectorAgent 去编排多个 SOTA 视频模型、再用 CriticAgent 校验的框架,走的都是 编排现有模型 + 保长程一致 这条路,而不是从零训一个能一口气生成十分钟的巨型模型。

腾讯团队的长视频 Agent 研究显示,主流做法都是"编排现有 SOTA 模型 + 跨镜头缝合",因为单段模型一次只能生成约 8–12 秒
因为单个视频模型受物理限制,一次能稳定生成的时长就是有限的;要出长片,编排几乎是唯一现实的路。 所以 vivago R1 选择做编排层本来在方向上就是被行业已经证实的。
▎第二,长片生成确实是苦天下久矣。
今天主流的 AI 视频,绝大多数还卡在秒级到两分钟:谷歌 Veo 3.1 单段大约 8 秒、多镜头拼到一两分钟,OpenAI Sora 2 大约 60 秒(而且消费端在 2026 年 4 月已经关停了),快手可灵 3.0 号称 导演级 、能到两分钟。换句话说,如果 vivago R1 真能稳定产出五分钟以上、还连贯不崩的成片,那它踩中的绝对是一块真实的市场空白和需求
▎第三,野心的方向是对的。
Sora 2 很早都到 60 秒了,它和 vivago R1 都想解决的问题是短镜头再好看,也拼不出一部能叙事、有人物、风格统一的片子。 长视频不是短视频的简单拼接——这句官方自己都承认的话,恰恰是这件事最难的地方。所以从以上调研的情况来看,R1 的产品决策是想清楚过的,不是蹭热点。 但 决策对 不等于 做得好 。方向选对了,能不能在一条五分钟的片子里真把活干成是另一回事——接下来我们就通过实测看看真实表现

04
现在声称自研的团队太多了,也许很多人同样也好奇 vivago 究竟有哪些创新和自研?
1.底层那个真正生成画面的视频模型,是自研的吗?
2.还是说上面那层做规划、编排、保一致性的 Agent 是自研的?
这两件事的含金量完全不同,也对应完全不同的故事。现有的公开证据指向一个比 纯自研 或 纯套壳 都更微妙的答案:
聚合侧:上文有提到 vivago 自己的 llms.txt 列了 Sora 2 / 可灵 v2.6 Pro / Veo 3 / Veo 3.1 + 自研 Vivago 2.0,并自称 多模型平台而非单一模型工具 。

vivago llms.txt:vivago 官网给 AI 看的说明文件里描述了自己是聚合 Sora 2、可灵、Veo 加自研 Vivago 2.0 的多模型平台。
自研侧:智象确实有自己的HiDream-O1-image 系列以及 video系列的自研模型——Vivago 2.0/2.1(图像+视频)在第三方评测站被独立测过(该视频模型现在已经改名叫 HiDream 2.0);公司也确有多模态自研底座的积累。

第三方模型库把 Vivago 2.1 列为智象自研的图像生成模型
也就是说 vivago 是一个 自研模型+ 聚合第三方视频模型 + 上层 Agent 编排 的混合体。
R1 的独家价值,大概率不在 底层画面全是自研模型画的 ,而在编排 + 长程一致性 + 长片能力这个领域。
后来生成视频的过程我通过逆向发现了一些有意思的信息:
首先请求的域名都在 vivago 自己家,没有任何第三方模型域名,说明模型调用全在服务端完成,前端只跟 vivago 网关对话。这是编排型平台的典型架构,也意味着底层调谁无法从域名层看出来。
vivago R1 是一个技能驱动的编排 Agent(同 Kimi Work / Anthropic Skills 谱系),17 个功能技能,覆盖视频/图像/电商/社媒等垂类。其中 cinematic-story-director 是最成熟的旗舰,后面实测我也发现效果最好的就是这个skill
模型被功能和技能抽象了,前端全程看不到模型名。比如用户看到的是 text-to-video、reference-to-video、cinematic-story-director,没有一个按模型命名。也就是说模型路由完全在服务端、被技能层封装。用户(乃至客户端层面的技术观察者)选的是"能力"(拍个电影故事/参考图生视频),而不是某个模型
技能参数里 duration 枚举 = 4,5,…,15 秒(默认 5)。→ 把之前"10s 封顶"细化为单段 ≤15秒;后面测试发现每段用了 10s。长视频仍是多段拼接。另外 generate_audio 默认 true(会配音频)。
这些分析证明 vivago 的产品定义非常清晰,用户不需要去选择模型供应商,就像我们不会问水电来源于哪家公司,面包里的面粉来源于那个牧场。大部分用户需要的永远是某个能力,而不是模型本身。说实话这让视频生成变的非常简单和纯粹,用户只需要关心我到底想要什么样的视频,而不需要再去纠结哪个模型什么更好,哪个更经济实惠,这些都由 vivago 的路由做了。

05
和自研一样, 无限这个词也得拆解开看。时长可以无限 和 一致性可以维持的有效时长 是两件完全不同的事。
一个视频能不能一直生成下去(时长无限),这在工程上不难,分段生成、首尾相接就行。
生成出来的东西能不能一直连贯、人不崩脸、风格不跳、故事不断——这才是真正难的地方,也是官方点名要解决的四个问题:画面跳变、人设崩塌、叙事断层、风格割裂。
▎案例一 叶什尔查姆风格的荒诞科幻烂片
因此我没有用生成一条美食 vlog 这种谁都会测的题。而是设计了一个既有意思,又能能符合vivago 核心卖点的测试题:一部叶什尔查姆风格的荒诞科幻烂片。
叶什尔查姆是土耳其上世纪六到八十年代那批超低成本邪典片,最出名的就是 土耳其星战 那种——真人套着硬纸板喷银漆的怪兽服、泡沫塑料石头、手绘的外星球背景、演员绑着石头在蹦床上 飞 、把真实爆炸镜头直接剪进去。它的精髓是廉价,假得好笑 。
这道测试题有几个特点:
1.够荒诞、够好笑,天然是文章和视频的传播爆点;
2.多镜头、多机位、剧烈动作,把人设、道具、风格、叙事的一致性全压上;
3.跨场景的长叙事,正好测无限时长 ;
4.还有最有意思的一点:AI 的美化本能 与刻意的廉价之间会有博弈 。AI 的默认倾向是把画面往精致、真实里渲染,所以我们经常看到很多审美坍缩的 AI脸。而这部片子要求它维持廉价感的美学。比如对于那个硬纸板怪兽 R1 会不会忍不住把它偷偷渲染成一个光滑精致的 CGI 机器人? 如果会,那就是底层大模型的审美预设压过了 Agent 的指令,也就是常见的编排失控、风格漂移等问题。
从结论上来看成片可以说非常惊艳。
一分十一秒的成片,叙事、镜头、切换都很顺,场景、人物、道具从头到尾几乎不崩——那个八字胡红紧身衣的阿里队长、那个漏勺当头盔的纸板怪兽,从头到尾都是一个形象。廉价美学也守住了,没被偷偷渲染成精致 CGI。
如果非要挑毛病的话,41 秒左右有三四秒画面突然发黏、细节垮掉,风格和前后对不上,略微有点出戏;还有一分钟处背景从天台悄悄漂到了影棚,不过第一遍几乎看不出来,我回放了三四次才发现。这质量放在今天的 AI 视频里完成度打 95 分都不过分。

从 Agent 的过程日志来看,它跑的是一个叫 cinematic-story-director 的 skill,是一条 Node0→Node9 的流水线:
理解任务(N0) → 故事初稿(N1) → 视听剧本(N2) → 拆分场景(N3) → 美术指导(N4) → 生成角色/场景/道具的"锁定参考图"(N5) → 文字分镜(N6) → 视频提示词(N7) → 逐场景生成视频(N8) → 拼接成片(N9)。也就是说它先把我的构思写成故事、改成剧本、拆成一个个场景、定好统一的美术风格,然后单独生成"阿里队长""外星后院""机器暴君"这三张锁定的参考图,再让每一个镜头都对着这同一套参考图去生成,最后缝合成整片。从日志上来看短片 41 秒处突然发粘的画面应该就是某一段模型输出质量有偏移导致的。
从这个案例来看,几个问题都有了答案:
1.无限时长还是无限拼接 —— 工程上是拼接,体验上是时长,画面之间的转换缝的特别好。日志能看出它把片子拆成 7 个场景、各自独立生成、最后 Node9 采取拼接。

最后一步,7 段分镜被严丝合缝地拼成一部完整短片
2.惊艳的一致性靠的是工程编排。这个机制在 Node5 出现,它先单独生成了 A01 阿里队长、A02 外星后院、A03 机器暴君的锁定参考图,然后 Node8 给每一个分镜都用同一套参考图做"参考图生视频"。一致性来自"锁参考图 + 逐段参考图生视频",而不是来自某个模型的长程记忆。

开拍前,R1 先给主角出了一张三视图定妆照,之后每个镜头都照着它生成,这就是全片人物从头到尾不崩的秘密。
3.长任务思考是真的规划。它不是调个 API 直接出片,而是走了"故事→剧本→拆场景→美术→参考图→分镜→提示词"这么一整套结构化规划。这是真正的长任务思考,并不是用固定模板填空。而且它是 skill 驱动的(和 Kimi Work 的 SKILL.md、Anthropic Agent Skills 同源)。

没急着出片,先写好一集完整剧本、锁定角色/场景/道具清单
最最有意思的是,官方所说的无限时长肯定不能简单的理解为一次能生成一部两小时的电影,这不科学也不符合第一性原理。我理解这应该是指在长时间的制作中,具体的形象、道具、场景都能被固化为资产可复用,因此就能一直接着生成,每次都能顺着故事讲下去。我试着把土耳其队长的故事继续往下写了一个,没想到的是一致性真的非常好,人物、机器人形象高度统一,该换的换了,不该换的没换。
接下来请欣赏土耳其队长第二集:

06
上面这一个案例讲透,应该足够让大家认识 vivago 了。不过一部荒诞短片,主要测的是它「长片一致性 + 编排」这一面;而创作者在真实工作里会撞上的坑,远不止这一个。
所以后面这几条,我没挑它最擅长的去秀肌肉,而是每一条都对准一个「创作者天天会遇到、又刚好能验证某项具体能力」的场景,来把对它的认识补全——一条打形象可控(我要的是我自己的那个形象,不是 AI 瞎编的近似版),一条打理解力(给它一个现实里根本不存在的产品,看它是不是真能看懂),一条打批量生产(能不能一口气把一整个系列出完,而不用我一条条手动拼)。三个方向,正好是长片之外,创作者最容易翻车、也最想让 AI 替自己扛下来的三件事。
▎案例二《狗狗特工队》
这是一个无厘头默剧短片,主要想验证一下在复杂的人类动作上,是否能保证狗狗的身上不会长出人手人脚,并且在跨时间的视频生成中能否保证宠物形象的一致性。从生成结果上来看狗狗的肢体没出现任何漂移,哈士奇段落稍微有些假,并且车厢烟花和整个片子的风格不太像,可能是因为服务端切换模型有漂移。但瑕不掩瑜,总体质量很高,而且依旧是严格按照提示词来走的。
▎案例三 一个不存在的产品宣传片
官方一直说它"能理解任务"。那就给它一个现实里根本不存在的产品。我编了一个脑洞智能硬件:"装在厨房吊柜下、把菜谱步骤直接投到料理台上、说一声下一步就翻页、全程不用手碰"的投影模块,让它做一条发小红书的竖版宣传片。用不存在的产品,就是因为它没有现成素材可抄,必须真"看懂"这个东西是什么、怎么用,才拍得对。
总体来看在产品演示这种很复杂的场景里面,vivago 的表现就相对其他案例稍逊一筹,因为不管是模型还是编排都很难去理解这个不存在的产品是怎么用的,这涉及到世界模型的范畴了,用大语言/多模态模型来做确实有点难,因此视频中出现几个空间位置不符合产品逻辑的也能理解。总体完成度还是很高,这是毋容置疑的。
▎案例四 十二星座安全屋和战场魔法果实
不知道大家有没在社交媒体刷过这种视频,创作者的痛点是如果我要做十二星座,我必须生成十二个视频剪辑起来,观众的痛点是你标题写着十二星座,实际上我进去只能看三分之一,根本就没后续。这都是因为创作者使用多个短视频手动搓成一个长视频的。所以我想不如试试 vivago 能否一口气把成品都出了。

结果真的非常惊喜,我在提示词里面其实没把十二星座枚举出来,说实话跑之前还是挺担心成品出问题,但我没想到的是在规划阶段 vivago 真的把十二星座全部生成图片并进流程了(甚至还多了一个,不知道是什么隐藏星座),这真的让我大松一口气,我原本已经准备重新跑了(主要是花费时间和积分成本)。
从生成结果来看确实能把很多个场景串起来,不需要用户手动拼接,这真的太棒了。至于视频内容里面的穿帮、细节、运镜,是和提示词相关的,如果经过良好的提示词打磨必定能生成质量非常不错的内容。
战场魔法果实的成片也非常惊喜,场景、音效都很棒,要知道这只是简单几句提示词出来的效果,如果提示词上下点功夫去好好定义需求,完全可以用到生产级别的场景中。

07
把镜头从 vivago R1 这一个产品拉回整个行业会看到个越来越确定的趋势。
视频生成的模型能力正在变成水电一样的基础设施。
两年前谁的模型画得更清晰、更连贯就是绝对的胜负手。但到了 2026 年,Sora、可灵、Veo、海螺、即梦……第一梯队的画质差距在收窄,而且大多开放了 API——任何一个平台,都能把这些最强的模型接进来。 模型本身越来越像一种随时能采购的原材料。
当原材料变成标准供应商品的时候,稀缺性就会发生转移:从谁的模型更强,转移到谁能把一堆模型,编排成一个真正能干活、能交付的系统。这正是 vivago R1 这类创作 Agent 押注的地方——它不跟你比底层模型画得好不好,它跟你比"从你脑子里一个'我想拍条片'的念头,到一条能直接发出去的成片"之间,那段最脏、最累、最需要懂镜头语言和叙事的活,它替你干掉了多少。
这事儿其实特别像去超市买东西。可乐、伊利、金龙鱼这些成熟商品早就在大润发有、盒马有、山姆也有,货都一样。可人们为什么还是喜欢往某一家跑?可能正是因为它帮你把品选好了、动线理顺了、该配的服务配齐了,甚至有自己的招牌自有品牌(山姆的 Member's Mark)让你非它不可。咱们买的从来不只是货,买的是这家店把"逛—选—买—用"打通的整条体验。
这就是为什么"它是不是聚合了别人的模型"从来不是重点。聚合是手段,编排才是产品,或者说穿了最终体验才是兵家必争之地。 一个创作 Agent 的价值,在于它替你把"想法"到"成片"那段路铺平了多少。
回到这次实测——那部土耳其烂片的完成度、那条把一个个镜头缝成连贯长片的流水线,足够说明它在这段路上已经铺得相当远了。

