当前位置: 首页 > news >正文

Minimax Music开源,配套神器已开源,继AI视频自由后,AI音乐也自由了!

Minimax Music开源,配套神器T8已开源,继AI视频自由后,AI音乐也自由了!新版comfyui整合包V18更新,写一个教程

MiniMax Music 3 开源 + ComfyUI V18 整合包教程

就在昨天,继开源视频模型 H3 之后,MiniMax 又把音乐模型MiniMax-Music3给开源了。配合 T8 大佬刚更新的ComfyUI V18 整合包,AI 音乐本地自由,现在真的实现了。


一、MiniMax-Music3 是什么?

一句话:一个能在你本地电脑上生成最长5分钟完整歌曲的AI模型,带人声,还支持中文/日文等多种语言

它和 Suno、Udio 这类在线工具最大的不同是——模型权重完全免费开放,你可以下载到本地,没有任何次数限制,想生成多少首就生成多少首。

效果到底怎么样?

目前开源TTS/SVS领域,MiniMax-Music3绝对是顶级的(SOTA级别)。虽然和顶级的闭源商业产品(比如 Suno)比还有一点差距,但在开源模型里,它已经是天花板了。

硬件门槛:官方推荐24GB显存(如RTX 4090),实测生成3分钟歌曲约需219秒。整合包也支持通过配置在更低显存下运行。


二、下载与安装(V18整合包)

T8 大佬已经把所有依赖和环境都打包好了,不需要自己配 Python 环境。

MiniMax Music 3 模型 夸克网盘分享

T8 CF 整合包 V18 夸克网盘分享

T8 配套节点仓库https://github.com/T8mars/comfyui-minimax-h3-prompt-enhancer-T8

官方模型 Hugging Facehttps://huggingface.co/MiniMaxAI/MiniMax-Music3

官方提示词技能 (Skills) https://github.com/MiniMax-AI/MiniMax-Music3/tree/main/skills

安装步骤

  1. 下载整合包和模型文件
  2. 解压整合包,路径不要有中文
  3. 把模型文件放到ComfyUI/models/minimax_music/目录下
  4. 双击run_nvidia_gpu.bat启动 ComfyUI


三、核心玩法:如何写提示词

MiniMax-Music3 不是随便写一句“来首悲伤的歌”就能出好效果的。它需要结构化的描述,就像给音乐人写一份制作需求单。

官方推荐的三段式结构:

1. 全局信息

  • 流派/子流派、BPM(速度)、调性
  • 情绪走向(从哪到哪)
  • 收听场景、制作风格

2. 人声细节

  • 性别、音色特质、演唱风格
  • 和声、背景人声、效果

3. 编曲与段落

  • 主奏/辅奏乐器
  • 每个段落(主歌、副歌、桥段)的乐器变化
  • 律动、低音、打击乐、空间感

示例(直接可复制修改):

Warm Mandarin pop / traditional Chinese ballad, 74 BPM, A-flat major. Tender nostalgia opens into a celebratory chorus, with a mature male baritone-tenor, delicate guzheng, soft strings, gentle acoustic textures, expressive vibrato, and a natural live-room sound.

歌词格式

歌词需要用段落标签来标记结构,这样模型才知道哪里是主歌、哪里是副歌:

[Verse 1] 歌词第一段内容... [Pre-Chorus] 过渡段内容... [Chorus] 副歌内容... [Bridge] 桥段内容... [Outro] 尾奏内容...

如果不想自己写,可以用 MiniMax 官方提供的Skill(提示词生成器),输入主题就能自动生成结构化的描述和歌词。Skill 在官方 GitHub 的skills目录下。


四、ComfyUI 工作流使用

工作流节点说明

V18 整合包中,核心节点是MiniMax Music 3 Generator

输入

说明

Caption

上面的三段式结构化描述

Lyrics

带段落标签的歌词

Duration

生成时长(最长300秒)

模型选择

  • minimax_music3_dit_fp16.safetensors推荐,显存够用就选这个
  • minimax_music3_dit_int8_convrot.safetensors:显存较低时使用

生成后通过SaveAudioAdvanced节点导出 WAV 文件。

常用参数建议

  • 采样步数:官方建议 2-4 步即可,因为是 Flow Matching 架构
  • 目标时长:建议从 60 秒开始测试,确认效果后再拉长


五、常见问题

Q1:报错 "block cache" 相关?

T8 的整合包已经修复了这个问题,更新到 V18 即可。如果自己装的节点,更新ComfyUI-MiniMax-H3-BlockCache-T8到最新。

Q2:生成的歌声音不稳定/走调?

检查提示词是否写了足够的结构信息。只写一句话的描述效果通常不好,尽量按三段式把 BPM、调性、乐器、段落变化都写清楚。

Q3:为什么只有 32kHz?

目前开源版本输出是 32kHz 16-bit 立体声 WAV,比 CD 音质(44.1kHz)稍低,但做 Demo、视频 BGM、播客配乐完全够用。

Q4:能生成纯音乐吗?

可以。歌词留空,或者把is_instrumental设为 true,就会生成无人声的纯音乐版本。


六、相关资源汇总

资源

链接

官方 GitHub

GitHub - MiniMax-AI/MiniMax-Music3 · GitHub

Hugging Face 模型页

https://huggingface.co/MiniMaxAI/MiniMax-Music3

官方 Demo(在线试听)

MiniMax Music 3

官方 Skill(提示词生成)

MiniMax-Music3/skills at main · MiniMax-AI/MiniMax-Music3 · GitHub

ComfyUI 官方工作流

MiniMax Music 3:テキストから音楽 - ComfyUI Workflow


祝玩得开心!记得给 大佬和官方点个 Star~🎵

http://www.cnnetsun.cn/news/4049959.html

相关文章:

  • 从PID到模型预测:管道小球摆杆控制的核心难点与工程实现
  • RAG 召回率 95% 仍答错:Anthropic 重排机制差点让我交差一份科幻小说
  • Python包发布全流程指南:从项目打包到PyPI上架
  • 实测了 JDK 25 的紧凑对象头:堆省 19%,GC 暂停降 33%
  • ESP32智能小车实战:从零搭建循迹避障跟随机器人
  • STM32F103入门实战:从开发环境搭建到GPIO、串口、定时器核心外设精讲
  • Minecraft版本全解析:Java版与基岩版核心差异、版本号逻辑与实战选择指南
  • PADS Layout安全间距检查报错:从原理到实战的完整排查指南
  • HarmonyOS文件预览服务开发实战与优化指南
  • 生物信息学工作流云原生实践:Nextflow 在 Carolina Cloud 上的迁移与部署指南
  • 华为交换机堆叠技术实战:从原理到配置,构建高可靠网络架构
  • 亚马逊选品插件推荐: 六大功能模块逐个实测
  • 从回测到实盘:基于大语言模型的量化交易AI智能体架构与实战
  • 从用户连接到业务自动化:个人微信API打通获客转化留存全链路
  • Xcode快捷键实战指南:从核心逻辑到深度定制,提升iOS开发效率
  • 爬虫转大模型:采集能力变成竞争力,我踩过哪些坑?
  • TuneLab调音软件使用指南:从FFT原理到钢琴调律实战
  • 基于Cloudflare Worker与MCP协议实现AI Agent去中心化服务发现
  • 吃个奶酪吧
  • 优化.NET开发环境:迁移NuGet全局包文件夹的完整指南
  • Windows下MinGW环境配置全攻略:从MSYS2安装到IDE集成
  • 2026年全球高分子材料行业:研发专用丙烯酸应用价值解析分享
  • 基于Hadoop的美食推荐系统的设计与实现(源代码+文档+PPT+调试+讲解)
  • i++与 ++i赋值运算区别_bak2
  • 从Context Engineering到Harness Engineering:AI工程范式的演进与实战
  • USB Type A 2.0和3.0的区别
  • 代码评审实战指南:从核心价值到AI赋能的高效实践
  • RAG技术详解:从原理到实战,构建高效检索增强生成系统
  • 龙虾处理全攻略:从结构解析到烹饪预处理,避坑实操指南
  • 从模型幻觉到工程实践:构建生产级大语言模型Prompt的完整指南