快手可灵月活破780万登顶,OpenAI却砍掉Sora押注“土豆”:AI视频生成迎来“中国时刻”
一边是快手可灵AI以780万月活登顶全球AI视频生成工具榜首,商业化年收入运行率突破3亿美元;另一边是OpenAI悄然关停Sora,转而曝光代号“Spud”(土豆)的全新预训练模型,声称要打造“超级应用”。2026年春天,AI视频生成赛道迎来戏剧性转折——国产多模态应用正在全球市场高歌猛进,而曾经的行业标杆却选择战略性撤退。这背后,究竟是一场技术路线的分化,还是商业逻辑的重新洗牌?
一、可灵登顶:国产AI视频的“逆袭时刻”
1.1 数据说话:780万月活,断层领先
市场情报机构Sensor Tower的最新数据显示,快手旗下AI视频生成应用可灵AI在2026年3月的移动端月活跃用户(MAU)已达到780万,而同期OpenAI的Sora仅为470万。更值得注意的是,这还是在Sora关停之前的数据——在Sora正式退出舞台后,可灵的领先优势进一步扩大。
增长势头同样强劲:仅3月最后一周,可灵全球周活跃用户(WAU)环比增长4%,平均规模达260万。这一数据标志着可灵已成功登顶全球移动端AI视频生成工具的“新王座”。
1.2 商业化爆发:ARR破3亿美元,年收入有望翻倍
用户规模的领先直接转化为商业化的爆发。据快手2025年第四季度财报显示,可灵AI第四季度收入达3.4亿元,全年总收入突破10亿元关口。
更令市场瞩目的是,快手科技创始人兼首席执行官程一笑在业绩电话会上透露:截至2026年1月,可灵的ARR(年化收入运行率)已突破3亿美元,公司对今年实现收入同比翻倍以上增长有较强信心。
从收入结构来看,可灵已经形成了清晰的商业化路径:
个人订阅:C端用户付费使用视频生成功能
企业API:为专业创作者和企业客户提供底层能力
生态赋能:与快手内容生态深度融合,形成闭环
广发证券分析认为,可灵AI在视频生成领域保持第一梯队优势,模型迭代和商业化或超预期,有望成为快手中长期新增长曲线。
1.3 技术底气:为什么是可灵?
在技术层面,可灵的核心竞争力体现在三个维度:
角色一致性可控性:AI视频生成最大的痛点之一是角色在不同场景下的形象一致性。可灵通过多模态视觉语言(MVL)理念,实现了文字、图像、视频等多模态的指令输入,确保角色在长视频中的稳定呈现。
物理真实感:算法针对真实物理世界进行了深度建模,生成的动态画面符合物理规律,避免了AI视频常见的“飘忽感”。
复杂场景稳定性:在高复杂度场景(如多人互动、快速运镜)中保持输出稳定,这正是专业级用户的核心诉求。
技术演进路径清晰可见:从可灵2.0的MVL理念,到O1模型的多模态交互深化,再到3.0系列的All-in-One统一框架,快手正沿着统一原生多模态方向持续迭代。
1.4 Sora“离场”后的权力交接
可灵的崛起,恰逢Sora的战略性撤退。此前,Sora的关停在全球AI创作者群体中引发了巨大反响,留下的市场真空迅速被可灵等国产工具填补。
这一“权力交接”背后,反映了中美AI应用路线的分化:美国巨头更倾向于押注底层模型突破,而中国企业则在应用场景和商业化落地上走得更快。正如行业观察者所言,这是视频生成领域的“中国时刻”。
二、OpenAI的“土豆”战略:砍掉Sora,All-in AGI
2.1 Sora为何被边缘化?
就在可灵高歌猛进的同时,OpenAI却做出了一个令人意外的决定——关停Sora,将其研发团队并入机器人领域。
OpenAI联创兼总裁Greg Brockman在近期播客中首次详细解释了这一战略调整的原因:
“我们到了一个节点——技术已经验证可行,但必须进入真实世界。在算力有限的情况下,同时推进两个差异巨大的产品分支非常困难。”
核心逻辑很清晰:OpenAI确信文本模型可以走向AGI,而视频生成(Sora)与核心推理模型(GPT系列)在技术架构上是不同的分支。与其分散资源,不如将所有火力集中在一条路径上。
Brockman透露,一位物理学家研究了很久的难题,OpenAI模型在12小时内就给出了解决方案。这种“思考”能力让他们必须加倍下注。
2.2 “土豆”(Spud)是什么?
取代Sora的,是一款代号为“Spud”(土豆)的全新预训练模型。这并非简单的GPT-X迭代,而是凝聚了OpenAI过去两年心血的全新架构。
根据多方爆料(X平台@iruletheworldmo等),GPT-6(即Spud)的核心参数如下:
| 特性 | 参数 |
|---|---|
| 架构 | “Symphony”原生多模态 |
| 上下文窗口 | 200万Token |
| 性能提升 | 较GPT-5.4全面跃升约40% |
| 预训练完成 | 2026年3月17日 |
| 预计发布 | 2026年4月14-16日 |
| 定价 | 输入$2.5/百万Token,输出$12/百万Token |
更关键的是,GPT-6被定位为AGI的“最后一公里”。Brockman表示,迈向AGI的进度已完成约80%,而GPT-6就是剩下的那20%。
2.3 技术突破:200万上下文与System-2推理
GPT-6的核心技术突破集中在三个方面:
200万Token上下文窗口:采用“分层稀疏注意力”与“滚动记忆缓存”技术,可一次性处理整本书、完整项目文档或超长视频。这相当于GPT-5.4的两倍容量。
System-2逻辑引擎:新增双系统推理架构——System-1负责直觉式快速响应,System-2负责内部逻辑校验和事实核查。官方宣称幻觉率可降至0.1%以下,在数学、医疗、法律等专业领域有望实现“零错误”。
Symphony原生多模态:文本、图像、音频、视频、3D实现原生统一编码,所有信息共享同一向量空间,而非传统的“文本为主、多模态拼接”。
2.4 “超级应用”:OpenAI的终极野心
模型之外,OpenAI更大的战略是打造一款整合编程、浏览器和ChatGPT的“超级应用”(Super App)。
Brockman描绘了这一应用的愿景:
“它不仅是工具,更是你的‘个人助理’——了解你、与你的目标一致、值得信任。你想让电脑做什么,直接告诉它就行,电脑会顺应人类,而不是人类顺应电脑。”
具体规划上,超级应用将分步推进,起点是Codex应用——它既是通用的智能体框架,能调用各种工具,又擅长写软件。未来几个月,这一框架将接入电子表格、Word文档等知识工作场景。
这解释了OpenAI为何砍掉Sora:不是视频生成不重要,而是在通往AGI的路径上,OpenAI选择了“文本→推理→智能体”这条主线。视频能力不会被放弃,但将被整合到统一的多模态框架中,而非作为独立产品线存在。
三、两条路线的碰撞:谁是对的?
3.1 可灵的胜利:场景驱动的商业化逻辑
可灵的成功验证了一条与OpenAI截然不同的路径:以场景驱动技术迭代,用商业化反哺研发。
快手没有等待“完美模型”诞生,而是快速将可灵推向市场,在真实用户反馈中持续优化。程一笑在电话会上坦言:“当前视频生成在技术和产品层面都远没有到成熟的地步。”但这并不妨碍可灵通过移动端优先的策略抢占C端市场——相比Web端的繁琐操作,手机端的随时随地创作更符合大众习惯。
数据证明了这一策略的有效性:可灵全年收入破10亿元、ARR超3亿美元,这在AI视频生成赛道中堪称标杆。更重要的是,可灵与快手内容生态形成了正向循环——AI生成的内容有了天然的落地土壤,创作者有了变现渠道,平台也因此获得差异化竞争力。
3.2 OpenAI的豪赌:AGI优先的长期主义
OpenAI的选择则是另一种极端:砍掉所有旁支,All-in AGI。
Brockman在播客中透露,OpenAI内部从2025年12月起一直处于“编程红色警报”状态。原因很简单:Anthropic的Claude Code等AI编程产品在真实世界场景中表现出色,大量用户被抢走。这让OpenAI猛然意识到——“原来只靠文本,真的有可能通往AGI”。
于是,奥特曼做出了一个大胆决定:砍掉几乎所有非核心产品线,包括一度备受期待的Sora和与之相关的迪士尼十亿美元合同。所有资源被集中投入到GPT-6(Spud)的研发中。
这是一场豪赌。赌的是:只要模型足够强大,应用场景自然会来。Brockman对此充满信心:“我们已经确信文本模型可以走向AGI——AGI就在眼前,今年还会有更强的模型。”
3.3 殊途同归?未来可能走向融合
两条路线看似对立,实则可能在未来走向融合。
可灵的成功并不否定OpenAI的路线,而是展示了在当前技术阶段,场景落地和商业化的重要性。即使模型不完美,只要找准用户痛点(移动端便捷创作、物理真实感、角色一致性),就能在市场上占据一席之地。
OpenAI的路线则代表了更长远的技术愿景:只有突破AGI的瓶颈,才能解锁真正颠覆性的应用场景。Brockman透露,OpenAI内部正在研发“自动化AI研究员”,计划秋季推出,能够承担相当比例的科研任务。这种能力显然远超当前的视频生成工具。
从技术演进来看,双方都在向统一多模态的方向靠拢。可灵从3.0开始采用All-in-One理念,将多模态输入输出纳入同一模型框架;OpenAI的Spud则从底层实现了文本、图像、音频、视频的原生统一编码。殊途同归——未来的AI模型必然是统一多模态的。
四、行业启示:AI视频生成的下半场
4.1 国产应用的黄金窗口期
Sora的退场为国产AI视频工具打开了一个难得的窗口期。可灵的成功证明:在AI应用层,中国企业完全有能力实现全球领先。
这背后的优势是多方面的:
移动端基因:中国互联网公司在移动端产品体验和用户获取上有天然优势
内容生态支撑:快手、抖音等内容平台为AI生成内容提供了现成的分发渠道和变现路径
快速迭代能力:中国团队在产品迭代速度和用户反馈响应上更具灵活性
爱诗科技的PixVerse V6也已发布,在AI视频生成榜单中位列全球第二。国产AI视频工具正在形成矩阵优势。
4.2 OpenAI的战略转向:AI进入“应用时代”
OpenAI砍掉Sora、聚焦超级应用的战略转向,释放了一个重要信号:AI竞争已从“模型军备竞赛”进入“应用落地”阶段。
模型能力固然重要,但如何让用户真正用起来、愿意为之付费,才是决定胜负的关键。超级应用的战略,正是要将OpenAI的技术能力整合为一个统一、易用、高粘性的产品入口。
Brockman的比喻很形象:OpenAI的模型就像迪士尼的米老鼠,是核心IP;超级应用则是围绕这一IP打造的“迪士尼乐园”,让用户真正沉浸其中。
4.3 开发者的新机会
对于AI开发者和创业者来说,当前的行业格局意味着新的机会:
短期机会:可灵等国产工具正在快速成长,围绕其生态的插件开发、模板创作、内容服务等领域存在大量机会。
中期机会:GPT-6发布后,其200万上下文窗口和System-2推理能力将解锁前所未有的应用场景——长文档处理、复杂任务自动化、智能体协作等。
长期机会:统一多模态模型的出现,将模糊文本、图像、视频、音频的边界。能够跨模态创作的“全能型AI应用”将是下一波创业热点。
4.4 风险与挑战
当然,前景并非一片坦途。
对于可灵等国产工具,挑战在于:技术天花板尚未突破。视频生成在角色一致性、长视频连贯性、物理真实感等方面仍有明显局限。一旦OpenAI或其他国际巨头重新加码视频赛道,竞争格局可能再次变化。
对于OpenAI,风险在于:过度集中押注AGI路线可能错失应用层的先机。当可灵已经在C端市场站稳脚跟、形成用户习惯时,OpenAI的超级应用尚未面世。模型再强,如果没有用户和数据飞轮,也可能在应用层落后。
五、写在最后
2026年的春天,AI视频生成赛道迎来了真正的分野。
一边是可灵以780万月活、3亿美元ARR的成绩单,向世界证明中国AI应用的实力;另一边是OpenAI壮士断腕,砍掉Sora、All-in“土豆”模型,为AGI的最后一公里发起冲刺。
两条路线,各有各的逻辑,各有各的赌注。可灵赌的是场景先行、商业反哺,OpenAI赌的是技术突破、应用随行。
谁能笑到最后?答案或许不重要。重要的是,这场竞争正在加速AI从技术概念走向真实应用——而这,对所有人来说都是好消息。
毕竟,AGI的终极目标,不是谁赢谁输,而是让智能真正服务于每一个人。
