当前位置: 首页 > news >正文

从跑通到出片:JoyAI-Echo 分钟级长视频生成完整上手指南

从跑通到出片:JoyAI-Echo 分钟级长视频生成完整上手指南

【免费下载链接】JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。项目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo

JoyAI-Echo 是一款分钟级多镜头音视频生成工具:给它一份镜头脚本,它能产出带同步音频的长视频,故事最长 5 分钟,角色外观和音色在镜头切换之间保持稳定,推理速度比原始多步管线快约 7.5 倍,单张 48GB 显存的显卡就能跑默认配置。官方 GSB 用户测试里,对比同场景竞品的偏好度为音频质量 81.7%、提示遵循 80.6%、视觉美观 63.6%、角色一致性 59.4%,长视频场景的优势比较明确。

机器能不能跑:显存、依赖和权重先核对

默认配置是 1280×736 分辨率、每镜头 241 帧、25fps,峰值显存约 46–50GB,所以单张 H100/A100(80GB)或任何 48GB 以上的卡都能直接跑。显卡更小也不是不能用,把帧数和分辨率降下来即可,命令见后文。

核对项要求
GPU 显存峰值 46–50GB;单卡 48GB 起即可
软件栈Python 3.11 + PyTorch 2.8 + CUDA 12.8,另需 FFmpeg
权重文件主权重 echo-longvideo-release.safetensors 与文本编码器 gemma-3-12b/

软件栈对应仓库里的 environment.yml 和 requirements.txt,照着装即可。权重需要单独获取后放到推理目录下的 checkpoints/,布局固定为:

checkpoints/ ├── echo-longvideo-release.safetensors └── gemma-3-12b/

另外注意许可边界:该项目基于 LTX-2,遵循 LTX-2 Community License,限定学术研究与非商业用途,商用需另行联系版权方。

第一次推理怎么跑通

代码和推理脚本从仓库获取:

git clone https://gitcode.com/jd-opensource/JoyAI-Echo cd JoyAI-Echo

环境用 uv 两步搞定(也支持 conda,按 environment.yml 创建):

uv venv --python 3.11 .venv && source .venv/bin/activate uv pip install --extra-index-url https://download.pytorch.org/whl/cu128 -r requirements.txt

权重就位后直接运行:

python inference.py

结果输出在 inference_result/outputs/<提示文件名>/inference_<时间戳>/ 下,视频和音频在同一目录。第一次建议就用默认配置跑一个单镜头,确认画面、音频、输出路径都没问题,再去做多镜头。

提示词怎么写:每个镜头包含六个部分

提示词文件放在 prompts/ 目录下,内容是单个 JSON 对象,prompts 字段是一个字符串列表,每个字符串就是一个完整镜头:写一个字符串出单镜头,写多个就是多镜头故事。新镜头会自动参考前面镜头的视觉与语音记忆,故事级一致性由跨模态记忆库维持。

每个镜头内部按固定顺序写六部分,缺了哪部分,生成时哪部分就容易失控:

部分写什么
角色与主体画面中所有人的外观:年龄、体型、发型、五官、服装,有台词的还要写音色
动作与台词角色做什么、说什么
风格整体视觉与情绪基调,如写实电影感、冷调日光
镜头运动景别与运镜,如面部稳定特写、腰部以上中景
背景主体身后的场景与细节
音效与 BGM场景声音和背景音乐,或明确写"无背景音乐"

官方特别强调一点:提示词先过增强器再推理。多镜头用 prompts/long_story_writer_system_prompt.md,单镜头用 prompts/short_story_writer_system_prompt.md,把简短想法扩写成规范的镜头描述——不扩写直接喂模型,效果明显偏弱。

效果不达预期时怎么调

症状调整
角色外观或音色前后镜头漂移每个镜头用同一套描述词写角色(服装、发型、音色),别换说法
画面和文字描述对不上先用增强器把提示词扩写成完整镜头描述,再推理
显存不够或生成太慢降帧数和分辨率:python inference.py --num-frames 121 --video-height 480 --video-width 832
多镜头衔接生硬在相邻镜头提示词里补过渡描述,保持场景与时间线连贯

先用单镜头、低分辨率把整条流程跑通,确认画面和声音都正常后,再回到默认 1280×736、241 帧出正式片子;提示词记得先过增强器再交给模型。

【免费下载链接】JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。项目地址: https://ai.gitcode.com/jd-opensource/JoyAI-Echo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4249862.html

相关文章:

  • 【必收藏】从0到1掌握AI智能体:大模型的进化与应用实践
  • audioMotion.js频谱分析仪设置与预设完整指南:Sensitivity、Peaks、加权滤波器,调出最适合你的频谱响应
  • ifconfig.io porttest功能实战:一条curl命令测试服务器远程端口是否可达
  • PowerSync多框架实战对比:一套同步代码跑通React、Vue、Angular与Nuxt的差异详解
  • 遗留系统 Canvas 兼容策略:ExplorerCanvas 部署指南与向 HTML5 的平滑迁移路线
  • 为什么Essential Paxos是学习Paxos的经典教材?与Multi-Paxos及Composable Paxos的设计哲学深度对比
  • 8款主流AI论文平台横向实测,本硕博撰稿避坑实操指南
  • 三款AI写作辅助软件横评:从构思到提交怎么选才不踩坑?
  • 大模型应用开发必备,RAG技术详解与工具选型:LlamaIndex、GraphRAG、 RAGFlow
  • 右键菜单管理三步走:用 ContextMenuManager 把 Windows 右键菜单彻底清理干净
  • 2002-2024年地级城市道路面积、人均道路面积
  • 从零开始学MoE:混合专家模型技术详解,助你掌握大模型高效训练秘籍,建议收藏!!
  • 收藏必备:从提示工程到上下文工程,构建高性能AI Agent完全指南
  • Office Custom UI Editor:不写一行代码定制 Office 功能区,10 分钟让常用按钮前置
  • 别再手动逐个比对了:HashCalculator 批量计算与校验文件哈希的完整指南
  • 收藏必备:从RAG到RL Agent,检索系统的革命性升级!
  • 如何用一条命令构建全栈应用:Skeet TypeScript Serverless框架终极入门
  • 1900行深度学习工具库全解析:Dive-Into-Deep-Learning-PyTorch-PDF的d2lzh.py自定义层与训练函数设计原理
  • 从 Docker 到 Kubernetes:node-oracledb 容器化部署的 6 个关键决策与避坑指南
  • 定制laravel-logger:扩展自定义路由、视图与活动模型的完整指南
  • 降漏写成法定义务之后,分区计量与工单闭环如何让地下漏点显形
  • 八大网盘拿到真实直链:LinkSwift网盘直链解析工具实操指南
  • 低成本LoRA微调ChatGLM3-6B:从数据准备到模型部署
  • AI挖掘机落地指南:从感知、规划到真机部署的完整实践
  • PaperTodo 快速上手:10 分钟把今天的待办贴到桌面
  • material-scrolling源码精读:RecyclerViewHolder如何桥接ObservableRecyclerView滚动状态
  • axure-cn Axure 汉化语言包安装教程:15 分钟让 RP 9/10/11 变成中文界面
  • 如何为 doc2dash 编写自定义解析器:从 Parser 协议到 Patcher 的完整插件开发指南
  • WinScript 快速上手指南:把 Windows 精简、隐私与性能优化变成勾选操作
  • PDF补丁丁完全使用指南:免费开源PDF工具箱,书签编辑与批量处理快速上手