
分析师/贾玥
校对/Tina
策划/Eason
2026年WAIC,最戏剧性的一幕发生在一组数字对比里。
一边是Kimi K3宣布即将开源,DeepSeek、Qwen持续迭代新版本,大语言模型的性能曲线仍在陡峭爬升;另一边,OpenRouter全平台每日Token消耗量从3月的2T飙升至7月的接近7T,API使用量正在爆发式扩张。
但你若去问那些API服务商的毛利率,答案可能并不性感。Token价格持续下行、用户切换成本接近于零、模型能力快速趋同——最火的赛道和最难赚的钱,同时成立。
就在同一时间窗口,另一条叙事线在资本市场上演:多模态视觉生成公司智象未来(HiDream.ai)宣布完成15亿元C轮融资,近三个月累计三轮融资超21亿元,投后估值突破10亿美元,正式跻身独角兽。
五类资本罕见同框:社保基金和工银资本领投,华策影视、上影股份等产业资本跟投,合肥产投等地方国资,以及东方富海、敦鸿资本等头部创投机构从A轮一路追到C轮。
这引出一个核心问题:当基座大模型越来越“卷”,AI厂商的下一个锚点在哪?多模态能否成为新的护城河?
大语言模型的同质化困局,正在从预言变成现实。
Kimi K3开源的消息之所以引发震动,不在于它有多强,而在于它击穿了一个底层逻辑:闭源模型垄断前沿能力的叙事正在瓦解。当能力趋同,模型服务就不可避免地滑向价格战和低毛利循环。Token单价持续走低,用户切换成本几乎为零——你今天用谁的API,明天就能换另一家,模型之间的差距正在以肉眼可见的速度缩小。
在这样的背景下,AI产业的增长曲线开始发生转移。资本和创业者都在寻找下一个确定性的方向——答案越来越清晰地指向多模态。
为什么?因为多模态的商业价值正在被加速验证。
首先是市场空间的量级差异。语言模型解决的是"理解与生成文本"的问题,而多模态解决的是"理解与生成世界"的问题——后者覆盖的行业和场景至少大一个数量级。影视、广告、电商、游戏、教育、文旅……每一个垂直领域都是一个百亿级的独立市场。正如行业里流传的一个判断:语言模型的终局是"超级入口",多模态的终局是"超级生产力"。
其次是场景绑定的天然深度。视觉生成能力天然嵌入高价值生产流程——一部影视剧的分镜设计、一个电商SKU的批量广告素材、一个游戏角色的多视角原画生成。一旦模型与客户的素材库、业务系统、团队协作流程深度绑定,迁移成本远高于换一个LLM API。
更重要的是商业确定性的差异。语言模型的付费意愿建立在"提效"之上——帮员工写邮件、写周报、查资料,价值感相对模糊。而多模态生成直接产出可商用的内容资产——一条广告片、一组电商主图、一段剧情预告片,价值可量化、可定价。客户愿意为"直接产出"付费,这是多模态商业模型跑得通的底层原因。
还有一个结构性的格局差异。通用大语言模型赛道容易形成"一两个模型一统天下"的赢家通吃格局,但多模态赛道天然分散——影视、传媒、社媒、广告、文旅,每个行业的叙事逻辑、审美标准和审核规则都不同。这给垂直深耕的玩家留下了结构性机会。
目前国内视觉生成赛道的格局正在从"群雄逐鹿"走向"梯队分化":快手的可灵、字节的Seedance等大厂依托流量和资本优势卡位;生数科技、爱诗科技等创业公司各有技术侧重。而智象未来凭借原生全模态架构创新和商业化闭环,在这一众玩家中占据了独特的身位。
那么,智象未来凭什么能在一众玩家中获得顶级资本的持续重注?
2026年6月,智象未来完成15亿元C轮融资的消息传出时,不少人的第一反应是:凭什么?
毕竟视觉生成赛道早已不是蓝海。大厂和创业公司扎堆涌入,产品功能趋同、效果差距缩小,行业似乎正在滑向和大语言模型一样的同质化困局。但资本用真金白银给出了不一样的判断。
答案藏在技术架构里。
当前多数视觉生成模型走的是一条成熟但存在天花板的路线:VAE做压缩,独立文本编码器处理语义,生成器负责输出。VAE压缩会损失高频细节,文本和图像分别编码又造成语义对齐的天然间隙——两者之间永远隔着一层翻译损耗。
智象的做法是:砍掉VAE和独立文本编码器。取而代之的是自研的原生全模态UiT架构——将图像像素、文本Token、视频体素、音频、动作、空间关系等所有原始信号,直接映射进同一个共享Token空间,与一套像素级统一的Unified Transformer交互。
本质差异在于:不是“先编码再拼接”的多模态,而是“从出生就在同一个空间”的原生全模态。
沿着这条技术路线,智象完成了一系列关键里程碑的积累:
2023年9月,60亿参数视觉多模态大模型起步
2024年7月,发布全球首个DiT商用大模型
2024年12月,全球首创扩散自回归模型
2025年,HiDream-I1登顶Artificial Analysis图像竞技场,成为首个登顶该榜单的中国自研生成式AI模型
2026年4月,HiDream-O1-Image发布,闭源版本达千亿参数,六项基准测试达到SOTA
2026年5月,开源模型登顶AA文生图榜单开源全球第一,同月发布超2000亿参数Pro版
2026年6月,商用版HiDream-O1-Image-1.5再次登顶AA榜单中国图像生成模型第一,全球前三

正是在这一系列技术积累之上,智象正式推出了原生全模态UiT架构,完成了从"多模态拼接"到"原生全模态"的跨越。
值得注意的是,行业巨头的动作正在验证同一方向。2026年初,谷歌发布Gemini Embedding 2,将文本、图像、音视频、PDF融合进统一向量空间;英伟达推出Nemotron 3 Nano Omni,将全模态感知、理解、推理整合为单一模型闭环。原生全模态正在成为行业共识路线,而智象未来提前卡位这一前沿方向。
“大语言模型不可能走向AGI,因为它无法指导机器与真实世界的交互。”梅涛曾这样阐述他对世界模型的理解。在他看来,一个真正的世界模型需要同时具备三种能力:表达世界、推演世界、构造世界。这也是为什么智象从一开始就没有选择做“文本模型的视觉插件”,而是直接走上原生全模态的底层架构重塑之路。
在技术底座之上,产品是检验商业化逻辑的最终标尺。
2026年盛夏,WAIC 2026现场,智象未来正式发布了全球首个无限时长内容创作多模态智能体——vivago R1。这标志着AI在创意生产领域的一次范式转移:从辅助生成单点素材,进化为能够自主规划、调度并完成长链路创作任务的“智能搭子”。

目前,vivago已覆盖5000万专业个人用户,拥有百万级付费用户。今年5月,vivago在全球顶级科技产品首发平台Product Hunt上拿下日榜第一。单款特效曾创下单月新增千万用户的爆款纪录。
带着“vivago凭什么跑出来”这个问题,我们和智象未来vivago产品负责人聊了聊。
它解决的,不是"生成一段视频"的问题
多数视频生成模型能产出令人惊艳的短视频片段,但一旦进入真实生产场景——持续运营剧情账号、批量生成电商广告、在客户多轮修改中保持角色一致性——问题就暴露了:时长一拉长,人物变形;剧情一复杂,场景漂移;改一处,推倒重来。
"最关键的决策只有一个:在视频生成最热闹的时候,我们决定不再做'更好的生成工具',而是把vivago做成一个替用户完成创作的智能体系统。"产品负责人说。
这个转身,意味着能力分发从"模型分发"改成了"方法分发"。
回顾vivago的演进路径,团队经历过两次关键站队。2024年初,在行业尚未形成共识时,vivago就确定了"文本→图像、图像→视频"的可控技术路线,当年5月产品在海外上线,成为全球最早一批公开可用的DiT架构视频生成产品——这次站队让vivago活了下来,进入第一梯队。
"但真正决定我们是谁的是第二次。"产品负责人说。如果说第一次站队是选择了DiT这条技术路线,那么第二次站队,是在原生全模态UiT架构之上,重新定义了产品的底层逻辑。团队主动放弃了"功能更多、模型更全"这个最容易讲的卖点,把vivago从"更好的生成工具"翻转为"替用户完成创作的智能体系统"。到R1版本,vivago已经是一站式AI Agent创作工具,今年5月完成Agentic升级并拿下Product Hunt日榜第一,并获得最顶尖的product hunter Chris Messina的高度评价"Think Claude Code, but for video"。
"行业的竞争正在从模型能力转向'基础模型+智能体系统'的生态竞争,"产品负责人说,"我们只是提前把船掉了头。"
为什么是"无限时长"?
"工具解决的是'生成一条素材',即使更轻量也不会改变本质,"产品负责人说,"而真实的商业创作是长链路任务,这中间隔着一条鸿沟。"以分镜为例——不仅要根据剧本生成画面,还要懂镜头语言、叙事节奏、情绪表达,甚至要区分vlog、短剧、商品素材对分镜的差异化要求。"这绝非直接调用大模型API就能实现。"
更根本的驱动力来自用户的反差信号:真正深度使用vivago的人,不是"玩一次就走"的尝鲜者,而是每天在上面完成工作的职业创作者。他们不想要更多参数选项,他们想要的是把专业执行整个交出去。
"这一代AI产品里,收入跑得最快的智能体产品,用户量未必最大,但深度用户的重度使用撑起了惊人的商业价值,"产品负责人说,"他们要的恰恰是长链路的完整交付。"
这就是vivago选择"无限时长内容创作智能体"而非"更轻量的视频生成工具"的全部逻辑——轻量解决的是"做一条视频",智能体解决的是"做完一件事"。
分层记忆 + 多Agent协作,是怎么落地的?
要实现"无限时长"的稳定输出,核心难题不在生成能力本身,而在记忆系统。传统视频生成模型内容越长,计算越重,一致性越难保证。vivago的解法是重新设计记忆架构。
底座是AgentOS,在它之上,编剧、分镜、生成、质检等专家角色像一个专业团队一样协同。所谓"分层记忆",落地为三层用户可感知的机制:
任务层——Agent理解你的目标、素材和约束,人物形象、镜头感觉可直接给参考;项目层——脚本、分镜、已确认版本沉淀在项目画布上,改一处全片保持一致;账号层——人物、产品、风格沉淀为跟随账号的资产,跨项目随时调回。
这套逻辑的本质是:把角色设定、叙事主线、风格规范沉淀为可复用资产,让创作起点从"空白画布"变为积累的资产库。
拿一个10分钟连续剧情短片来说:传统工具下,要拆成几十条片段逐条生成再拼接,主体漂移、风格跳变、废片率极高。在vivago R1里,角色、世界观、风格是全片共享的记忆,约束每一个镜头,长故事分段并发生成。"传统工具生产的是片段,vivago交付的是一部完整的片子。"
"传统工具迭代的是功能,我们迭代的是协作,"产品负责人说,"产品的进化速度,取决于人机共创的样本量,而不是需求列表的长度。"
从爆款到沉淀:用户增长的底层逻辑
单款特效单月新增千万用户,这个爆款是怎么发生的?
"爆款是运气,更是'技术拐点×大众入口'的一次共振。"产品负责人说。当时智象通过自研3D视频模型加推理加速,把特效生成从分钟级压缩到秒级——"等待消失了,分享的冲动还热着。"
但团队从中沉淀的最重要心得,不是爆款方法论,而是一个战略转向:重心从追求新增规模,转向经营每一位创作者的深度价值。爆款负责把人带进门,更夯实的功能负责让人留下来。
这也解释了为什么5000万用户中,最典型的"超级用户"是海外社媒剧情账号、电商素材的深度内容生产者。他们月生成量已经是专业生产管线的量级,以几乎全勤的强度在开工。"整体场景和我们最初的设想基本方向是一致的,"产品负责人说,"但是创作强度确实比我们想的更高。"百万级付费用户的驱动力也验证了这一点——连续生成不出错、可迭代、可协作,才是付费的核心驱动力。
产品哲学的底层逻辑
vivago的产品路线选择,折射出一个更底层的判断:在AI内容生产领域,替代创作者和赋能创作者,是两条完全不同的路。
vivago选择了后者。它不是要替代编剧、导演或剪辑师,而是把AI定位为"扛住底层一致性和规模化"的角色——模型负责稳定输出,多Agent负责流程协作,分层记忆负责长期连贯性。创作者始终掌握创意主导权。
这套逻辑如果跑通,意味着多模态赛道的护城河,最终不只在模型能力本身,更在模型与场景的深度绑定。
关于下一步,产品负责人说:"vivago从'会创作的智能体'长成'运行智能体的系统'。在AI技术飞速跃进的时代,很难定义最终形态。我们也在认真评估把这份产能开放出去,融入更多创作生态——开放的生态是必然的。"
目前vivago已覆盖全球120多个国家和地区。用户规模和付费转化验证了方向,但真正的考验在于:规模化扩张的同时,能否让分层记忆和多Agent系统在处理数万种不同创作需求时保持同等稳定性。
当技术和产品都通过了市场验证,资本市场的反应就不难理解了。
2026年6月,智象未来宣布完成15亿元C轮融资。至此,近三个月累计三轮融资超21亿元,投后估值突破10亿美元,正式跻身独角兽行列。
而在融资推进的同时,小编还查到,智象未来主体公司已完成股份制改造,更名为"智象未来(合肥)科技股份有限公司"。这意味着公司治理结构已对接资本市场要求,为下一步发展做好了制度准备。
这笔融资的资本结构,在国内视频生成赛道相当罕见。我们将其拆解为三层:
国家队顶层。社保基金联合建信投资、四川振兴投资等共同设立的市场化产业基金完成领投。从已披露的公开信息来看,这可能是社保基金作为LP在原生全模态世界模型方向的首次出手。同为本轮领投方的工银资本,也将智象作为其投资的第一家大模型企业。
产业资本中坚。华策影视此前已先后投资智谱华章和快手可灵,此次战略投资智象未来,双方将在影视语料共建、短剧工厂、AI影视创作智能体"帧赞"等方向深度协同。上影股份同期宣布战略投资,合作方向涵盖院线场景创新营销、IP联合开发。更早的A轮,湖北电影集团就已入局,双方联合实验室已于2025年底揭牌。
市场化创投和地方国资底座。深创投、东方富海(B轮领投,C轮跟投)、敦鸿资本等头部创投机构持续加码。地方国资层面,合肥产投从A轮追到C轮,八家合肥背景机构参与投资——在"芯屏汽合、集中生智"的产业版图中,继科大讯飞之后,智象未来成为合肥在大模型领域的又一重要落子,充分体现了地方国资紧跟国家级资本战略布局的决心。
不同资本的投资逻辑各有侧重。社保基金看赛道站位和长期价值,工银资本看硬科技从0到1的突破,华策上影看产业落地能力,市场化创投看回报倍数和增长潜力。
五类资本同时下注同一家公司,本质上是对"原生全模态赛道+院士技术班底+商业化闭环"的三重共识。
估值梯度上,A→B→C轮梯次清晰,给二级市场留出了估值想象空间。商业化闭环已从模型到产品到付费完整跑通——5000万用户、模型和产品登顶全球榜单,这些不是PPT上的数字,而是已经被验证的市场信号。
在多模态大模型赛道,谁先完成资本化,谁就可能在行业收敛期占据更有利的竞争位置。
当然,真正的挑战在于,商业化的速度会不会吃掉技术迭代的深度。智象目前三条产品线同时推进——面向专业创作者的vivago、面向电商营销的HiBurst、面向影视行业的帧赞——资源如何在规模化和技术纵深之间分配,将考验团队的战略定力。
梅涛对行业终局的判断是:多模态大模型会收敛到少数几家,大厂大概三家,中等规模的三四家,总共六七家。智象能否在牌桌上坐稳,取决于能否把原生全模态的架构优势,持续转化为产品体验和产业生态的壁垒。
结语
大语言模型的价格战不会停,但AI产业的增长曲线不止一条。
多模态赛道的价值,不在于"又一个生成工具",而在于它重新定义了内容生产的底层逻辑——从"人创作"到"人+AI协作创作",从"单次生成"到"可持续运转的工作流"。这决定了用户粘性、商业毛利和竞争壁垒的根本差异。
智象未来3个月3轮21亿、五类资本同框、完成股改——这不是一个孤立的融资故事,而是一个行业信号:资本正在用钱投票,选择那些"把AI嵌入真实生产流程"的公司。
但融资和股改只是入场券。真正的比赛才刚刚开始。
从更宏观的视角看,谷歌、英伟达等全球科技巨头也在朝原生全模态方向演进,这意味着智象锚定的技术路线正在成为行业共识。但共识的达成也意味着竞争者的涌入——赛道在变宽,对手在变多。
对于一家成立仅三年多的公司来说,护城河从来不是一天挖成的。真正的壁垒不在融资额,不在参数规模,而在于一个看似简单却极难做到的事:让技术深度持续转化为产品体验,让产品体验持续沉淀为工作流的不可替代性。
技术可以追赶,参数可以超越,但嵌进工作流的不可替代性,才是护城河的真正深度。

