当前位置: 首页 > news >正文

丢进去一句话,3分钟出片:零基础AI视频生成工具Auto-Video-Generator实操

丢进去一句话,3分钟出片:零基础AI视频生成工具Auto-Video-Generator实操

【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor

想找一台零门槛的AI视频生成工具?Auto-Video-Generator就是干这个的:把一段主题文字丢进去,它自己写好稿、配好音、配上画面,直接出一条带字幕的成片。不用学剪辑,不用碰PR,你只需要会装Python和复制粘贴API密钥。

从零到能跑的AI视频生成服务

先跑起来,再谈优化。整个过程就四步:

git clone https://gitcode.com/gh_mirrors/au/auto-video-generateor cd auto-video-generateor pip install -r requirements.txt

装依赖这一步大概几分钟,其中 moviepy、edge_tts、qianfan 这些包会在后面被流程直接用到。

接下来配密钥。编辑根目录的config.env文件,一共5个API密钥,缺哪个功能就先配哪个:

密钥干什么用
DEEPSEEK_API_KEY生成解说文案,调用DeepSeek接口,几块钱能用很久
DOUBAO_TTS_APPID豆包语音合成的应用ID,给文案配音
DOUBAO_TTS_ACCESS_TOKEN豆包语音合成的令牌,配合上一项使用
QIANFAN_ACCESS_KEY百度千帆的访问密钥,文生图走它
QIANFAN_SECRET_KEY百度千帆的密钥,配合上一项使用
python main.py

启动后浏览器打开 http://127.0.0.1:9020/ ,看到界面就算跑通了。入口逻辑在main.py里,不带参数启动的是默认的第4版界面(免费+校对模式),也支持传参数 1 到 4 切换不同版本。

图:Auto-Video-Generator的AI视频生成参数配置界面,上半部分设主题、图像和语音参数,下半部分是一键生成和各分步按钮

点下"一键生成"后,工具替你干了哪五步

很多人不知道它内部怎么跑,其实就一条流水线,代码都写在auto_video_generateor/video_generateor.py里。

第一步,把主题发给 DeepSeek,让它按你写的提示词模板产出一段口语化的解说文案,前半部分讲清内容核心,后半部分讲案例故事。第二步,用分句逻辑把整段文案切成不超过30字的小段,后面每一句都会独立配一张图、配一段音,所以分句质量直接决定节奏。第三步,每句文案送进语音合成接口(默认豆包TTS,免费版可切 edge-tts),生成一堆 mp3。第四步,每句文案转成画面提示词,调千帆的文生图模型出 1280x720 的配图,图下面还会烧上那句解说文字。第五步,moviepy 把音频和图片按顺序拼成视频轨,再叠上字幕,输出最终的 video.mp4。所有素材按 代号 归档在本地目录里,文本、音频、图片各归各的文件夹,方便你回头单独改。

这条链子上任何一环不满意都可以只重跑那一环,而不是从头再来——这一点下一节细说。

丢主题进去生成,或者把PPT变成视频

如果你是老师,做课程讲解视频最省事:在主题框里写清知识点和教学目标,比如"用3分钟讲清楚蝴蝶效应,面向初中生,配两个真实故事",选个稳重的男声音色,一键生成后把生成的文案过一遍眼,术语不对就在校对界面改文字再重新合成语音,其他资源都不用动。

如果你是做自媒体的,按固定风格批量产片是关键。第一次把图像风格描述、音色、语速调顺之后,点"保存参数"给它起个代号;下一篇同系列内容直接"加载参数",连音色都不用重选,只改主题就行。这个代号机制也方便你把某个项目的全部资源原样调回来继续加工。

图:Auto-Video-Generator的代号管理与资源加载界面,选择代号后一键拉回之前保存的参数和已生成的AI视频素材

如果你手头有现成PPT,还有条更快的路:上传PPT文件,系统把每张幻灯片当画面、把备注栏当逐字稿,直接配音视频化,适合企业内部培训这种"内容已定、只欠表现"的场景。走这条路要额外装 LibreOffice 并配好环境变量,其余步骤一样。

调这几个参数,成片质量差很多

不是参数越多越好,真正值得花时间的就这五个。

主题按"主题+风格+关键元素"写。"讲人工智能"和"讲人工智能发展史,纪录片口吻,包含1956达特茅斯会议和2012年ImageNet两个节点",出片差距非常明显,后者等于提前给文案和配图都定了锚。

音色和语速先试听再定。界面里音色下拉框可以试听,默认的 Yunxi 男声偏讲述感;语速、音量、音调三个滑条放在 50 到 60 之间最稳,拉到边缘容易发闷或发飘。

画面尺寸用 1280x720 就够。这个比例适合B站、抖音横屏,生成速度比 1080p 快一截,先出片再考虑高清。

校对要逐条点"已确认"。一键生成完之后别急着渲染视频,一条条翻:文本改不改、语音听着顺不顺、配图跑没跑偏。只有勾了"已确认"的条目才会真正进片,这一步是成片质量的最大分水岭。

图:Auto-Video-Generator的AI视频生成资源校对界面,左边逐句核对文本与提示词,右边试听语音、预览配图,确认无误后再合成视频

动手前你可能想问的几个问题

需要会编程吗?不需要。界面是 Gradio 做的网页,鼠标能点到的一切就是全部操作,代码你一行都不用看。唯一的门槛是装 Python 依赖和复制粘贴密钥。

五个密钥必须全配吗?不强制。只生成文案加用 edge-tts 配音的话,免费额度就能跑;但文生图默认走千帆,QIANFAN 那两个密钥建议配上,不然配图环节会缺胳膊少腿。

某一张图或某一句配音不满意,要重跑全部吗?不用。在校对界面找到那条资源,取消"已生成"再点一次"已生成",系统只重做这一句的语音或重出这一张图,其余素材原封不动,最后点"已确认"就生效。

一条视频要等多久?取决于文案被切成的句数,每多一句就多一张图加一段音频。短文案通常几分钟,长文案十几分钟起,生成过程中下方资源列表会实时刷新进度,也可以先去干别的,回来用"加载资源"把没生成完的补齐。

main.py 后面带不带参数有什么区别?不带参数进第4版(免费+校对),是目前功能最全的;带 1 是最简版,带 2 是全程基于千帆的版本,带 3 是免费直通版。刚开始玩就默认进4版,别折腾。

把主题丢进去,剩下的交给它

主题想好了吗?装好依赖、配好5个密钥、python main.py 一敲,三分钟后的浏览器里就有一条带解说的成片在等你挑毛病。

【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4175293.html

相关文章:

  • DataWave REST API参考手册:query、plan、lookup、predict等核心接口使用指南
  • MT Bench 8.12分如何炼成?Starling-LM-7B-beta评测成绩深度解析
  • Backtrader 完整指南:10 分钟跑通量化回测,避开 3 个结果失真的坑
  • upsert 踩坑清单:时区 UTC 转换、类型强校验、事务夹具冲突等 5 个新手常见的 Upsert 陷阱
  • Notepad2:轻量、启动快的免费文本编辑器,支持语法高亮与编码识别
  • Maka Agent:本地优先AI桌面助手如何重塑你的工作流
  • 参与开源贡献:如何为GenLayer Project Boilerplate提交第一个高质量的PR?
  • 为什么不用LoRA?揭秘gpt4-x-alpaca用GPT-4数据全量微调3轮的训练秘诀
  • 10分钟玩转G-Helper:华硕笔记本调校指南
  • 招聘平台四大站一次看全职位发布时间:求职者的完整指南
  • Casdoor API 实战教程:5 步完成第一次接口调用
  • 5 分钟生成整套 OpenCore EFI:OpCore Simplify 黑苹果自动构建工具
  • Buff 系统设计
  • 把PS3游戏跑流畅:RPCS3性能调优与配置完整指南
  • 1.4MB 跑通 107 种语言文本转语音,eSpeak NG 凭什么这么轻?
  • Redisson 与 Spring Boot 版本冲突:3 步定位并解决的排查指南
  • PoB2 物品系统完整流程:从装备模拟到词缀优化的实战指南
  • 一条命令搞定中国省市区街道 sql/json 数据:从克隆到入库指南
  • StableLM-3B-4E1T能力有多强?7项Open LLM Leaderboard基准测试完整分析
  • Wordless 多语言语料库工具避坑指南:安装到启动 4 个高频问题一次解决
  • LeadQualifier 10分钟快速上手:从安装到跑通你的第一个线索资格审查模型
  • AI论文写作工具推荐:5款学术助手怎么选?
  • DeepSeek-V3 检查点解析实战:.safetensors 与权重索引,671B 权重怎么落地
  • 贪心还是采样?Kronos-small NPU 确定性解码的取舍与temperature/top-p概率预测启用方法
  • 5条curl命令搞定Redis同步:RedisSyncer创建、启动、停止与查询任务实战
  • HackRF驱动问题排查:3步跑起来
  • DVWA Web 漏洞靶场保姆级指南:5 分钟跑通,19 个模块带你练完 SQL 注入和 XSS
  • PDFMathTranslate:免费公式级PDF论文翻译
  • 单链表专题
  • 从awesome-python3-webapp到iOS App:跨平台开发实战经验完整指南