当前位置: 首页 > news >正文

快手可灵月活破780万登顶,OpenAI却砍掉Sora押注“土豆”:AI视频生成迎来“中国时刻”

一边是快手可灵AI以780万月活登顶全球AI视频生成工具榜首,商业化年收入运行率突破3亿美元;另一边是OpenAI悄然关停Sora,转而曝光代号“Spud”(土豆)的全新预训练模型,声称要打造“超级应用”。2026年春天,AI视频生成赛道迎来戏剧性转折——国产多模态应用正在全球市场高歌猛进,而曾经的行业标杆却选择战略性撤退。这背后,究竟是一场技术路线的分化,还是商业逻辑的重新洗牌?

一、可灵登顶:国产AI视频的“逆袭时刻”

1.1 数据说话:780万月活,断层领先

市场情报机构Sensor Tower的最新数据显示,快手旗下AI视频生成应用可灵AI在2026年3月的移动端月活跃用户(MAU)已达到780万,而同期OpenAI的Sora仅为470万。更值得注意的是,这还是在Sora关停之前的数据——在Sora正式退出舞台后,可灵的领先优势进一步扩大。

增长势头同样强劲:仅3月最后一周,可灵全球周活跃用户(WAU)环比增长4%,平均规模达260万。这一数据标志着可灵已成功登顶全球移动端AI视频生成工具的“新王座”。

1.2 商业化爆发:ARR破3亿美元,年收入有望翻倍

用户规模的领先直接转化为商业化的爆发。据快手2025年第四季度财报显示,可灵AI第四季度收入达3.4亿元,全年总收入突破10亿元关口

更令市场瞩目的是,快手科技创始人兼首席执行官程一笑在业绩电话会上透露:截至2026年1月,可灵的ARR(年化收入运行率)已突破3亿美元,公司对今年实现收入同比翻倍以上增长有较强信心。

从收入结构来看,可灵已经形成了清晰的商业化路径:

  • 个人订阅:C端用户付费使用视频生成功能

  • 企业API:为专业创作者和企业客户提供底层能力

  • 生态赋能:与快手内容生态深度融合,形成闭环

广发证券分析认为,可灵AI在视频生成领域保持第一梯队优势,模型迭代和商业化或超预期,有望成为快手中长期新增长曲线。

1.3 技术底气:为什么是可灵?

在技术层面,可灵的核心竞争力体现在三个维度:

角色一致性可控性:AI视频生成最大的痛点之一是角色在不同场景下的形象一致性。可灵通过多模态视觉语言(MVL)理念,实现了文字、图像、视频等多模态的指令输入,确保角色在长视频中的稳定呈现。

物理真实感:算法针对真实物理世界进行了深度建模,生成的动态画面符合物理规律,避免了AI视频常见的“飘忽感”。

复杂场景稳定性:在高复杂度场景(如多人互动、快速运镜)中保持输出稳定,这正是专业级用户的核心诉求。

技术演进路径清晰可见:从可灵2.0的MVL理念,到O1模型的多模态交互深化,再到3.0系列的All-in-One统一框架,快手正沿着统一原生多模态方向持续迭代。

1.4 Sora“离场”后的权力交接

可灵的崛起,恰逢Sora的战略性撤退。此前,Sora的关停在全球AI创作者群体中引发了巨大反响,留下的市场真空迅速被可灵等国产工具填补。

这一“权力交接”背后,反映了中美AI应用路线的分化:美国巨头更倾向于押注底层模型突破,而中国企业则在应用场景和商业化落地上走得更快。正如行业观察者所言,这是视频生成领域的“中国时刻”。

二、OpenAI的“土豆”战略:砍掉Sora,All-in AGI

2.1 Sora为何被边缘化?

就在可灵高歌猛进的同时,OpenAI却做出了一个令人意外的决定——关停Sora,将其研发团队并入机器人领域

OpenAI联创兼总裁Greg Brockman在近期播客中首次详细解释了这一战略调整的原因:

“我们到了一个节点——技术已经验证可行,但必须进入真实世界。在算力有限的情况下,同时推进两个差异巨大的产品分支非常困难。”

核心逻辑很清晰:OpenAI确信文本模型可以走向AGI,而视频生成(Sora)与核心推理模型(GPT系列)在技术架构上是不同的分支。与其分散资源,不如将所有火力集中在一条路径上。

Brockman透露,一位物理学家研究了很久的难题,OpenAI模型在12小时内就给出了解决方案。这种“思考”能力让他们必须加倍下注。

2.2 “土豆”(Spud)是什么?

取代Sora的,是一款代号为“Spud”(土豆)的全新预训练模型。这并非简单的GPT-X迭代,而是凝聚了OpenAI过去两年心血的全新架构

根据多方爆料(X平台@iruletheworldmo等),GPT-6(即Spud)的核心参数如下:

特性参数
架构“Symphony”原生多模态
上下文窗口200万Token
性能提升较GPT-5.4全面跃升约40%
预训练完成2026年3月17日
预计发布2026年4月14-16日
定价输入$2.5/百万Token,输出$12/百万Token

更关键的是,GPT-6被定位为AGI的“最后一公里”。Brockman表示,迈向AGI的进度已完成约80%,而GPT-6就是剩下的那20%。

2.3 技术突破:200万上下文与System-2推理

GPT-6的核心技术突破集中在三个方面:

200万Token上下文窗口:采用“分层稀疏注意力”与“滚动记忆缓存”技术,可一次性处理整本书、完整项目文档或超长视频。这相当于GPT-5.4的两倍容量。

System-2逻辑引擎:新增双系统推理架构——System-1负责直觉式快速响应,System-2负责内部逻辑校验和事实核查。官方宣称幻觉率可降至0.1%以下,在数学、医疗、法律等专业领域有望实现“零错误”。

Symphony原生多模态:文本、图像、音频、视频、3D实现原生统一编码,所有信息共享同一向量空间,而非传统的“文本为主、多模态拼接”。

2.4 “超级应用”:OpenAI的终极野心

模型之外,OpenAI更大的战略是打造一款整合编程、浏览器和ChatGPT的“超级应用”(Super App)

Brockman描绘了这一应用的愿景:

“它不仅是工具,更是你的‘个人助理’——了解你、与你的目标一致、值得信任。你想让电脑做什么,直接告诉它就行,电脑会顺应人类,而不是人类顺应电脑。”

具体规划上,超级应用将分步推进,起点是Codex应用——它既是通用的智能体框架,能调用各种工具,又擅长写软件。未来几个月,这一框架将接入电子表格、Word文档等知识工作场景。

这解释了OpenAI为何砍掉Sora:不是视频生成不重要,而是在通往AGI的路径上,OpenAI选择了“文本→推理→智能体”这条主线。视频能力不会被放弃,但将被整合到统一的多模态框架中,而非作为独立产品线存在。

三、两条路线的碰撞:谁是对的?

3.1 可灵的胜利:场景驱动的商业化逻辑

可灵的成功验证了一条与OpenAI截然不同的路径:以场景驱动技术迭代,用商业化反哺研发

快手没有等待“完美模型”诞生,而是快速将可灵推向市场,在真实用户反馈中持续优化。程一笑在电话会上坦言:“当前视频生成在技术和产品层面都远没有到成熟的地步。”但这并不妨碍可灵通过移动端优先的策略抢占C端市场——相比Web端的繁琐操作,手机端的随时随地创作更符合大众习惯。

数据证明了这一策略的有效性:可灵全年收入破10亿元、ARR超3亿美元,这在AI视频生成赛道中堪称标杆。更重要的是,可灵与快手内容生态形成了正向循环——AI生成的内容有了天然的落地土壤,创作者有了变现渠道,平台也因此获得差异化竞争力。

3.2 OpenAI的豪赌:AGI优先的长期主义

OpenAI的选择则是另一种极端:砍掉所有旁支,All-in AGI

Brockman在播客中透露,OpenAI内部从2025年12月起一直处于“编程红色警报”状态。原因很简单:Anthropic的Claude Code等AI编程产品在真实世界场景中表现出色,大量用户被抢走。这让OpenAI猛然意识到——“原来只靠文本,真的有可能通往AGI”。

于是,奥特曼做出了一个大胆决定:砍掉几乎所有非核心产品线,包括一度备受期待的Sora和与之相关的迪士尼十亿美元合同。所有资源被集中投入到GPT-6(Spud)的研发中。

这是一场豪赌。赌的是:只要模型足够强大,应用场景自然会来。Brockman对此充满信心:“我们已经确信文本模型可以走向AGI——AGI就在眼前,今年还会有更强的模型。”

3.3 殊途同归?未来可能走向融合

两条路线看似对立,实则可能在未来走向融合。

可灵的成功并不否定OpenAI的路线,而是展示了在当前技术阶段,场景落地和商业化的重要性。即使模型不完美,只要找准用户痛点(移动端便捷创作、物理真实感、角色一致性),就能在市场上占据一席之地。

OpenAI的路线则代表了更长远的技术愿景:只有突破AGI的瓶颈,才能解锁真正颠覆性的应用场景。Brockman透露,OpenAI内部正在研发“自动化AI研究员”,计划秋季推出,能够承担相当比例的科研任务。这种能力显然远超当前的视频生成工具。

从技术演进来看,双方都在向统一多模态的方向靠拢。可灵从3.0开始采用All-in-One理念,将多模态输入输出纳入同一模型框架;OpenAI的Spud则从底层实现了文本、图像、音频、视频的原生统一编码。殊途同归——未来的AI模型必然是统一多模态的

四、行业启示:AI视频生成的下半场

4.1 国产应用的黄金窗口期

Sora的退场为国产AI视频工具打开了一个难得的窗口期。可灵的成功证明:在AI应用层,中国企业完全有能力实现全球领先

这背后的优势是多方面的:

  • 移动端基因:中国互联网公司在移动端产品体验和用户获取上有天然优势

  • 内容生态支撑:快手、抖音等内容平台为AI生成内容提供了现成的分发渠道和变现路径

  • 快速迭代能力:中国团队在产品迭代速度和用户反馈响应上更具灵活性

爱诗科技的PixVerse V6也已发布,在AI视频生成榜单中位列全球第二。国产AI视频工具正在形成矩阵优势。

4.2 OpenAI的战略转向:AI进入“应用时代”

OpenAI砍掉Sora、聚焦超级应用的战略转向,释放了一个重要信号:AI竞争已从“模型军备竞赛”进入“应用落地”阶段

模型能力固然重要,但如何让用户真正用起来、愿意为之付费,才是决定胜负的关键。超级应用的战略,正是要将OpenAI的技术能力整合为一个统一、易用、高粘性的产品入口

Brockman的比喻很形象:OpenAI的模型就像迪士尼的米老鼠,是核心IP;超级应用则是围绕这一IP打造的“迪士尼乐园”,让用户真正沉浸其中。

4.3 开发者的新机会

对于AI开发者和创业者来说,当前的行业格局意味着新的机会:

短期机会:可灵等国产工具正在快速成长,围绕其生态的插件开发、模板创作、内容服务等领域存在大量机会。

中期机会:GPT-6发布后,其200万上下文窗口和System-2推理能力将解锁前所未有的应用场景——长文档处理、复杂任务自动化、智能体协作等。

长期机会:统一多模态模型的出现,将模糊文本、图像、视频、音频的边界。能够跨模态创作的“全能型AI应用”将是下一波创业热点。

4.4 风险与挑战

当然,前景并非一片坦途。

对于可灵等国产工具,挑战在于:技术天花板尚未突破。视频生成在角色一致性、长视频连贯性、物理真实感等方面仍有明显局限。一旦OpenAI或其他国际巨头重新加码视频赛道,竞争格局可能再次变化。

对于OpenAI,风险在于:过度集中押注AGI路线可能错失应用层的先机。当可灵已经在C端市场站稳脚跟、形成用户习惯时,OpenAI的超级应用尚未面世。模型再强,如果没有用户和数据飞轮,也可能在应用层落后。

五、写在最后

2026年的春天,AI视频生成赛道迎来了真正的分野。

一边是可灵以780万月活、3亿美元ARR的成绩单,向世界证明中国AI应用的实力;另一边是OpenAI壮士断腕,砍掉Sora、All-in“土豆”模型,为AGI的最后一公里发起冲刺。

两条路线,各有各的逻辑,各有各的赌注。可灵赌的是场景先行、商业反哺,OpenAI赌的是技术突破、应用随行

谁能笑到最后?答案或许不重要。重要的是,这场竞争正在加速AI从技术概念走向真实应用——而这,对所有人来说都是好消息。

毕竟,AGI的终极目标,不是谁赢谁输,而是让智能真正服务于每一个人。

http://www.cnnetsun.cn/news/1752976.html

相关文章:

  • SMB共享安全设置:如何在不降低安全性的前提下访问同一网段共享文件夹
  • 实测WuliArt Qwen-Image Turbo:1024高清图生成,细节拉满
  • Nunchaku-flux-1-dev与Git版本控制:生成项目进度可视化
  • Omni-Vision Sanctuary 效果增强:利用OpenCV进行后处理与结果可视化
  • astmd4169标准是什么,astmd4169测试等级怎么选,astmd4169包装完整性测试
  • Nunchaku-flux-1-dev与Git版本控制:AI项目协作开发实践
  • SECS-II与HSMS核心区别解析
  • 鄂尔多斯零碳产业园管理系统的创新亮点有哪些?
  • 员工离职后,被做成“AI数字人”继续打工,在职员工回应;曝亚马逊5月又要裁员1.4万人;工信部紧急提醒:iOS 13-17用户注意 | 极客头条
  • Llama-3.2V-11B-cot部署优化:利用Ollama本地镜像加速模型加载
  • Qwen3.5-9B实战教程:app.py添加流式输出支持+前端loading状态优化
  • 实测 2026 广告服务机构:一六八、蓝色光标等,谁更适配企业发展?
  • Kandinsky-5.0-I2V-Lite-5s效果展示:让照片“活”起来的惊艳案例
  • 告别锚框!用CenterPoint搞定自动驾驶3D检测,实测Waymo/NuScenes双SOTA
  • Linux 系统的交互式进程监控工具htop
  • AnythingtoRealCharacters2511新手必看:如何选择图片获得最佳转换效果
  • QMCDecode终极指南:3步解锁QQ音乐加密文件,让音乐自由播放
  • Fish Speech 1.5镜像CI/CD实践:GitHub Actions自动构建+镜像仓库推送流程
  • Wan2.2-I2V-A14B跨平台管理:使用MobaXterm设置中文环境并管理Linux服务器
  • LLM的创造力与不确定性:概率系统的双面性
  • 告别手动录入!用Zotero+Jasminum插件自动抓取知网元数据,高效管理学位论文PDF
  • 国产以太网变压器选型指南:从百兆到10G,哪些厂家值得关注?
  • 零代码AI视频制作:TurboDiffusion+Wan2.2让创意快速落地
  • MySQL查询核心语法详解
  • 告别HBox乱码:从零配置JupyterLab交互式进度条(含nodejs/yarn安装指南)
  • NaViL-9B开箱即用:无需下载权重,一键体验图片理解和文本对话
  • Docker 开源软件应急处理方案及操作手册——容器运行异常处理
  • 石化行业设备完整性管理数字化:破解运维痛点的核心方案
  • Qwen3-Embedding-4B vs text-embedding-3-small成本对比评测
  • 《供应商管理程序》落地版