手把手教学:用 Text-To-Video-AI 从文字到成片的 6 步完整实战流程
手把手教学:用 Text-To-Video-AI 从文字到成片的 6 步完整实战流程
【免费下载链接】Text-To-Video-AIGenerate video from text using AI项目地址: https://gitcode.com/gh_mirrors/te/Text-To-Video-AI
想用 AI 视频生成工具把一段文字变成一部有配音、有字幕、有背景音乐的完整短片?Text-To-Video-AI 就是这样一个开源的文字生成视频神器。它主打"从文字到成片"的全自动流水线:你只需要输入一个主题,它就能自动完成脚本创作、语音配音、字幕时间轴、背景音乐、B-roll 素材和最终渲染。本文将手把手带你走完 6 步完整实战流程,零基础也能快速上手。
一、Text-To-Video-AI 是什么?能做什么?
Text-To-Video-AI 是一个基于 Python 的 AI 视频生成工具,特别适合制作 YouTube Shorts、Instagram Reels、TikTok 等短视频。它的核心亮点包括:
- 🎬AI 脚本生成:支持 OpenAI、Groq、Google Gemini 三种大模型,输入主题自动产出爆款文案
- 🗣️智能配音:EdgeTTS(免费)或 ElevenLabs 两种方案可选
- ✍️精准字幕:Whisper 或 Deepgram 自动生成带时间轴的字幕
- 🎵背景音乐:接入 Suno AI 自动生成 BGM
- 🎥B-roll 素材:AI 视频模型(Veo、Sora、Kling 等)或 Pexels 免费素材库
- 🖥️双渲染引擎:MoviePy 快速渲染或 Remotion 高级合成
整个流程由 app.py 中的流水线调度,utility/pipeline_manager.py 负责断点续跑——即使中途失败,也能从断点继续,不用重头再来。
二、准备工作:最快安装配置方法
第一步:克隆项目并安装依赖
打开终端,依次执行以下命令:
git clone https://gitcode.com/gh_mirrors/te/Text-To-Video-AI cd Text-To-Video-AI pip install -r requirements.txt cp .env.example .env💡 Windows 用户可参考 INSTALL_WINDOWS.md 查看详细的安装教程;想在浏览器里直接体验,也可以打开 Text_to_Video_example.ipynb 使用 Google Colab 在线运行。
第二步:配置 .env 密钥(关键一步)
所有配置都在.env文件中完成,核心配置如下:
| 配置项 | 说明 | 是否必填 |
|---|---|---|
LLM_PROVIDER | 脚本大模型:openai / groq / gemini | 必填 |
OPENAI_API_KEY | OpenAI 密钥(选 openai 时必填) | 视情况 |
PEXELS_API_KEY | Pexels 免费素材库密钥 | 必填 |
MUAPI_API_KEY | AI 视频/音乐生成密钥 | 选填 |
TTS_PROVIDER | 配音:edgetts(免费)/ elevenlabs | 必填 |
STT_PROVIDER | 字幕:whisper(免费)/ deepgram | 必填 |
VIDEO_ORIENTATION | portrait 竖屏 / landscape 横屏 | 选填 |
RENDER_ENGINE | moviepy / remotion | 选填 |
配置校验逻辑集中在 utility/config.py,如果缺了密钥会直接报错提示,非常贴心。
三、6 步完整实战流程:从文字到成片
一切就绪后,只需要一条命令即可启动:
python app.py "你的视频主题"比如想做一个太空主题的科普视频,就运行:
python app.py "Wonders of Outer Space"第 1 步:AI 自动生成爆款脚本
程序会把你的主题发送给大模型,自动生成约 140 字、50 秒以内的短视频文案。脚本生成逻辑在 utility/script/script_generator.py,它会自动去掉 Markdown 格式,确保配音朗读时干净流畅。
第 2 步:生成自然流畅的配音
脚本生成后,系统立即调用 TTS 生成配音音频并保存为audio_tts.wav。推荐使用免费的 EdgeTTS,在.env中配置你喜欢的音色:
EDGETTS_VOICE=en-US-JennyNeural # 美国女声常用的音色还有en-US-ChristopherNeural(美国男声)、en-GB-RyanNeural(英式男声)等。
第 3 步:自动生成带时间轴的字幕
接下来,Whisper 会对配音进行语音识别,生成逐字逐句的时间轴字幕。你还可以自定义字幕样式:
CAPTIONS_ENABLED=true CAPTION_FONT_SIZE=100 CAPTION_FONT_COLOR=white CAPTION_POSITION=bottom_center CAPTION_STROKE_COLOR=black字体大小、颜色、描边、位置(顶部/居中/底部)全部可调,轻松做出电影级字幕效果。
第 4 步:AI 生成背景音乐
配置了MUAPI_API_KEY时,系统会调用 Suno AI 根据视频主题自动生成风格匹配的背景音乐,并自动将音量压低至 12%,保证人声清晰。
第 5 步:智能匹配 B-roll 视频素材
系统会结合脚本和字幕时间轴,为每一段内容自动生成搜索词,然后:
- 配置了 Muapi:调用 Veo3、Sora、Kling 等 AI 视频模型生成高质量片段
- 未配置:自动回退到 Pexels 免费素材库下载匹配的实拍视频
AI 生成失败还会自动降级到 Pexels,容错设计非常完善。
第 6 步:渲染合成最终成片
最后,utility/render/render_engine.py 会把配音、字幕、背景音乐和视频素材合成为最终视频,输出为rendered_video.mp4。
渲染引擎可选两种:
| 引擎 | 特点 | 适用场景 |
|---|---|---|
moviepy | 渲染快、依赖简单 | 快速出片 |
remotion | 基于 React 的高级合成 | 追求精致视觉效果 |
四、进阶技巧:3 个让成片质量翻倍的建议
技巧 1:竖屏横屏随心切换
短视频平台推荐竖屏(9:16),传统视频用横屏(16:9):
VIDEO_ORIENTATION=portrait # 或 landscape技巧 2:断点续跑,失败不慌
流水线每完成一步都会保存进度(见 utility/pipeline_manager.py),中途网络中断重新运行命令即可从断点继续,已生成的片段不会浪费。
技巧 3:AI 视频模型自由选择
在.env中指定MUAPI_VIDEO_MODEL即可切换模型:veo3-fast-text-to-video(快速)、kling-v3.0-pro-text-to-video(可灵)、openai-sora-2-pro-text-to-video(Sora)等,总有一款适合你的风格。
五、写在最后
Text-To-Video-AI 真正做到了"一句话生成视频":从脚本、配音、字幕到 B-roll、BGM、成片渲染,6 步全自动完成,无需任何剪辑经验。无论是做知识科普、口播文案还是营销短片,它都能帮你把想法快速变成作品。
现在就去克隆项目,输入你的第一个主题,体验从文字到成片的奇妙过程吧!🚀
【免费下载链接】Text-To-Video-AIGenerate video from text using AI项目地址: https://gitcode.com/gh_mirrors/te/Text-To-Video-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
