当前位置：首页 > news >正文

LongCat-Video：分钟级长视频高效生成模型

news 2026/6/23 7:04:58

LongCat-Video：分钟级长视频高效生成模型

【免费下载链接】LongCat-Video项目地址: https://ai.gitcode.com/hf_mirrors/meituan-longcat/LongCat-Video

美团龙猫团队正式发布LongCat-Video——一款具备136亿参数的基础视频生成模型，通过统一架构支持文本生成视频、图像生成视频和视频续播三大任务，尤其在分钟级长视频生成领域实现高效与高质量突破。

当前视频生成技术正面临三大核心挑战：多任务兼容性不足、长视频生成易出现色彩漂移和质量下降、高分辨率视频生成效率低下。随着AIGC应用从图片向视频领域延伸，广告制作、教育培训、影视创作等行业对长时、高清、低成本的视频生成工具需求日益迫切，LongCat-Video的推出恰逢其时。

LongCat-Video采用创新的时空轴粗细结合生成策略，在保持136亿参数规模的同时，实现了四大核心突破。其统一架构设计使单一模型原生支持文本到视频（Text-to-Video）、图像到视频（Image-to-Video）和视频续播（Video-Continuation）任务，避免了传统多模型方案的资源浪费。

如上图所示，该模型架构通过共享基础模块实现任务统一，其中视频续播预训练使其天然具备长时序生成能力。这一设计不仅降低了开发复杂度，还为跨任务视频创作提供了连贯的技术基础。

在长视频生成方面，LongCat-Video通过原生视频续播任务预训练，成功解决了传统模型在生成超过30秒视频时普遍出现的色彩偏移问题。测试数据显示，其生成的720P/30fps视频在连续播放5分钟后，色彩一致性指标仍保持初始值的95%以上，远超行业平均水平。

效率优化是另一大亮点。模型采用块稀疏注意力（Block Sparse Attention）技术，结合时空轴粗细生成策略，使720P/30fps视频生成时间压缩至分钟级。在单GPU环境下，生成1分钟时长视频仅需约4分钟计算时间，较同类模型效率提升3倍以上。

从图中可以看出，在文本对齐度、视觉质量和运动流畅性三项核心指标上，LongCat-Video以13.6B参数规模达到甚至超越了部分28B参数模型的性能。特别是在开源模型中，其综合表现已处于领先位置，验证了架构设计的高效性。

多奖励强化学习优化（GRPO）技术的应用，使模型在文本对齐（3.76分）和视觉质量（3.25分）方面取得平衡。在内部基准测试中，LongCat-Video的综合MOS评分达到3.38分，仅次于闭源的Veo3模型，展现出强劲的商业应用潜力。

LongCat-Video的开源特性（MIT许可证）将加速视频生成技术的普及进程。中小企业可借助该模型开发定制化视频工具，降低广告和培训视频的制作成本；教育工作者能快速将图文教材转化为动态视频内容；影视行业则可利用其视频续播功能实现剧情分镜的高效创作。

值得注意的是，社区开发者已基于LongCat-Video构建了缓存加速方案（CacheDiT），通过DBCache和TaylorSeer技术实现1.7倍推理加速，进一步拓展了模型的部署可能性。这种开源生态的快速响应，印证了该模型的技术价值和社区吸引力。

随着模型性能的持续优化和硬件成本的降低，LongCat-Video有望在未来1-2年内推动视频创作流程的根本性变革。其统一任务架构和长视频生成能力，也为构建更复杂的世界模型（World Model）奠定了基础，让AI从被动生成向主动理解物理世界迈出关键一步。

LongCat-Video的发布不仅是美团在AIGC领域的重要布局，更标志着国内视频生成技术已进入实用化阶段。对于开发者和企业而言，现在正是探索这一技术在垂直领域创新应用的最佳时机，抓住视频AIGC的浪潮，将成为下一波数字化转型的关键竞争力。

【免费下载链接】LongCat-Video项目地址: https://ai.gitcode.com/hf_mirrors/meituan-longcat/LongCat-Video

创作声明：本文部分内容由AI辅助生成（AIGC），仅供参考

查看全文

http://www.cnnetsun.cn/news/176421.html

9、Windows 10实用应用与微软应用商店使用指南

Ming-flash-omni：100B稀疏MoE多模态新标杆

ERNIE 4.5开放21B-A3B-Base模型

ERNIE-4.5轻量版PT模型开源：0.36B参数文本生成新选择

Excalidraw颜色主题定制：打造品牌专属视觉风格

Excalidraw结合AI生成token的商业变现路径

Emu3.5：原生多模态世界学习新范式

Excalidraw移动端适配现状与未来改进方向

Excalidraw Docker镜像体积优化方案

Excalidraw样式管理规范：CSS-in-JS还是原生？

Excalidraw PR合并策略观察：社区治理模式解读

20、数据迁移与备份：从Windows到Linux的无缝过渡

28、Linux桌面系统：许可证、发行版与企业选择全解析

Excalidraw内存泄漏检测与前端性能调优

Maven二方库

21、Windows系统实用工具与控制面板全解析

23、Windows系统设置与相关术语详解

Excalidraw如何助力初创团队低成本启动项目？

【光子AI】MCP 跟 Function Calling 的本质区别全解析

测量仪表的特性

Excalidraw在教育领域的应用探索：师生协作绘图

Excalidraw自定义组件库搭建方法论

30、进程间通信：命名管道与邮件槽的深入解析

Excalidraw助力技术文档可视化：提升沟通效率300%

Excalidraw绘图支持嵌入音频备注，多维信息承载

15、利用Media Player畅享音乐与影视世界

Excalidraw实战：绘制AI模型训练流水线架构图

Excalidraw镜像提供专属技术支持通道，响应迅速

Excalidraw支持导出为Latex格式，学术写作福音

Excalidraw镜像提供用量统计报表，便于成本控制

LongCat-Video：分钟级长视频高效生成模型

相关文章：