刚刚,MiniMax 正式发布 Music 2.6,我们魔改了一套 Skill
音乐生成,全面 Cli + Skill 化。
音乐生成,全面 Cli + Skill 化。

👦🏻 作者: 镜山
🥷 编辑: Koji
🧑🎨 排版: NCon

AI 音乐这件事,现在已经很难再用「新鲜」来形容了。
Suno 的用户每天生成超过 700 万首歌。什么概念呢,差不多每 3 周,就能填满一整个网易云的曲库。
汽水音乐靠着 AI 内容和短视频的联动打法,月活冲到了 1.39 亿,直接逼近网易云音乐。去年一位叫「大头针」的 AI 歌手,靠翻唱老歌在抖音拿下了 8.4 亿播放量,两个月涨粉 70 万。很多人到后来才反应过来,这根本就不是一个真人歌手。
到了这个阶段,AI 音乐对很多做内容的人来说,已经变成了一项基础能力。做短视频的人拿它生成 BGM,做播客的人拿它做片头片尾。对于有些独立游戏开发者来说,AI 配乐可能是他们唯一负担得起的方案。
也是在这个节点上,MiniMax 推出了 Music 2.6。
MiniMax 的音乐模型从 2.5 到 2.5+,一直在更新。作为国产 AI 音乐模型里跑得比较靠前的一个,这次 2.6 的更新,除了模型能力本身的提升,还带来了两个挺有意思的东西:Cover 功能,和一套可以在 Claude Code、Codex、OpenClaw 这类 Agent 产品里直接调用的开源 Music Skills。
🚥
接下来,我们会先聊聊 Music 2.6 这次升级了什么,然后分享我们的实测体验。
Music 2.6,升级了什么
先说模型本身,我们挑几个觉得比较关键的聊一下。
速度,这个可能是最直接的体感变化,2.6 把首包延迟压到了 20 秒以内,这个速度放在实际创作过程中,改变还是挺明显的,至少不会出现那种「等到把灵感都等没了」的情况。
然后是人声。2.6 在人声上做了一个调整:它在刻意让人声变得「没那么精准」。
之前很多 AI 生成的人声,每个音高、每个节拍都卡得特别死,反而会让人一耳朵听出来「这是 AI 唱的」。2.6 的人声多了一些随性的东西,气声的处理更松弛,转音的时候不那么刻板。整体听下来,更接近一个真人在放松状态下唱歌的感觉。乐器方面,种类扩充了不少,而且乐器之间在时间线上的配合更自然了。
还有一个做音乐的人会很在意的点:中低频,Bass 和鼓点的下潜更深了,咬合也更紧。这个东西文字很难描述,但你听一下就能感受到,有没有「律动感」,中低频基本上就是那个决定性的东西。
控制精度方面,BPM 和调式调性现在可以精准锁定了。以前你在 Prompt 里写 120 BPM,生成出来可能跑偏不少。现在基本能还原你写的数值。歌曲结构也是一样,主歌、副歌、Bridge 之间的段落走向更可控了。
上手实测:生成 + Cover
先从音乐生成开始。
我是用 Claude Code 接入 API 跑了一轮不同风格的测试,重点看 2.6 在速度、人声表现、中低频,以及控制精度这些点,实际表现怎么样。
先从最基础的开始,直接走 API 生成音乐。我这边给的是一段两分钟左右的暗黑电影配乐。元素比较明确:大提琴、法国号,再加一点很低沉的男声英文说唱。整体氛围偏压抑、冷感,就是典型的暗黑电影那一类声音。
提示词如下:
一段约 2分钟的暗黑电影配乐。开头为极简钢琴与低频环境音铺底,氛围冷峻、空旷随后逐步引入低音大提琴与法国号,音色厚重、压抑,强调持续低频张力与缓慢推进的情绪 中段开始出现低沉男声英文说唱元素,声音偏沙哑,处理为氛围化人声(低混响、远距离感),若隐若现,不突出歌词表达,更像是潜意识低语。 整体节奏不强调明确鼓点,仅隐约带有 Trap 风格的低频律动(弱化 Hi-hat,强化 808的深沉下潜感),以氛围驱动为主而非节拍驱动。 在**约1分钟处进入情绪峰值:弦乐与法国号叠加推高张力,但保持克制,不做宏大爆发,而是持续压迫感。整体风格:暗黑、压抑、冷感,类似心理惊悚电影配乐,强调“黑暗中缓慢逼近的力量**
接入这个 API 之后,其实用起来很直接。就在 claude code 里把提示词丢进去就行了,不需要额外折腾流程。生成速度也挺快的。

来听下效果。整体是那种潜意识低语的氛围,歌词也是英文低语风。
能明显听到压抑、冷感,还有持续往下压的那种感觉。弦乐、圆号这些叠起来的张力是在线的,不会散。男声部分偏一点嘶哑,但不突兀,整体还是自然的。到 50 秒左右有一段爆发,冲击力是够的。
接着试了一下 Cover。这块可以简单理解成,你给它一段参考音频,它会保住旋律的骨架,然后把风格、伴奏,甚至歌词都换掉。这个能力挺有意思的,我们反复玩了几轮。
最典型的是跨风格迁移。我直接拿刚才那段暗黑电影配乐,让它转成爵士版本。
先听前半段,没有明显高潮的地方,整体改得很顺,几乎没有违和感。旋律还在,但编曲和节奏已经是爵士那一套了。再听到 50 秒左右的高潮位置,它开始往上堆的时候,高音区的人声和整体编排也能跟着做风格切换,而且不突兀,还是比较自然。
当然,Cover 这个能力更适合拿熟歌来玩。因为你本来就对旋律有记忆,更容易听出它改了什么、保留了什么。
我这边找了一首很经典的童歌——兰花草,很多人应该都听过。拿这种熟旋律去做风格改写,效果会更直观。
然后你可以直接让它往短视频那一套去改,比如做成那种很"抽象"的抖音神曲,重点就是强律动、强节奏,方便做分发。
我这边用 兰花草 去做了一版这种改写。听下来挺有意思的,确实很魔性,也有那种"洗脑循环"的潜力。结构是完整的,不是乱拼。前奏一出来味道就对了,后面还叠了一些电音元素:
Cover 整体跑下来,让我印象比较深的是旋律的保留度。风格变了,伴奏完全换了,但那个旋律的「骨头」还是能认出来的。你手里随便一段旋律,自己哼的也好,AI 跑出来的也好,都可以拿来当素材,然后用 Cover 往各种方向去变。
所以你随便哼一段东西,后面可以玩的空间其实很大。
音乐生成,开始变成 Skill 了
这次 Music 2.6 更新里,让我们非常想聊的,其实是 Music Skills。
简单说,MiniMax 把音乐生成能力封装成了可以在 Claude Code、Codex、OpenClaw 这类 Agent 产品里直接调用的 Skill,而且是开源的。你可以直接拿来用,也可以在它的基础上改成适合自己的版本。
目前官方提供了 3 个 Skill:minimax-music-gen、minimax-music-playlist、buddy-sings,一个一个来说。
先说一下 minimax-music-gen,这基本就是这次 Minimax Music 2.6 的核心引擎,也是最关键的一块。
在 Claude Code 里直接用自然语言描述你要的音乐就行了。它会自己判断你是要做人声歌曲、纯音乐,还是做 Cover,然后把对应的流程在底层跑起来。
我这边用 Claude Code 调这个 skill 试了一下,它大致有三种模式,比如自动写歌词、人声演唱、基于已有音频做改编。核心是它会先解析你的提示词,看你到底想要什么,再决定走哪条生成路径,是做人声、纯音乐,还是拿一段音频去重做。

另外一个很实际的点是,这些 skill 本身都是官方开源的,所以可以直接在原来的基础上继续改,往里加新的功能路径。
我自己就顺手做了一个很实用的场景。比如很多幼儿园会用儿童早操歌,中学、高中也会有早上跑操的音乐需求。你如果直接去网上找,当然也能找到一些中文歌或者外文歌,但问题也很明显:节奏不一定合适,风格也未必统一,更别说批量生成了。
所以我就在这个 skill 上做了一点魔改。它先做模式识别,接着根据你给的要求和歌词,批量去生成多首。生成完之后,再让 Claude Code 回头做一轮校验,检查每首歌词是不是都不一样,差异够不够,旋律方向是不是也都符合我一开始设定的要求。
提示词可以很简单:
用这个 Skil,帮我做首幼儿园体操儿歌。
它自动识别了语言和创作模式,先跑了一版歌词出来,然后调用 Music 2.6 的 API 把歌生成了。整个过程没有离开终端。

我的想法是,让它连续跑 10 轮。每一轮都生成不一样的歌词,或者直接换一种风格。跑完之后,再自动把这一轮的结果全部过一遍,检查歌词是不是重复,风格差异是不是够大,成品有没有明显跑偏。
最后再把生成好的歌曲统一落地。可以直接存到本地,也可以进一步接到 IM 工具里,自动发到群里或者指定对话里。这样整个链路就比较完整了:

连续跑完 10 轮之后,它会把所有结果再逐条检一遍,确认没有明显问题再往下走。
这一步其实很有必要。因为像学生歌、儿童歌这种场景,对歌词内容会更严一点。不是只看能不能生成出来,还得看里面有没有不合适的表达,整体风格是不是稳,内容是不是适合直接拿去用。
等这一轮一轮检查都过完之后,生成好的文件就会自动存进本地文件夹。到这一步,后面要接广播系统其实就很顺了:

下面这首是我随便挑的一首,你可以重点听一下整体氛围和节奏。它的完成度是在线的,不只是旋律,歌词也是一整套出来的。
比较明显的一点是,「动作、歌词、节奏」是对得上的,有点现在幼儿园早操歌那种感觉。节奏点很清楚,歌词也会去配合动作指令,整体是可以直接拿去用的:
第二个是 minimax-music-playlist,可以理解成一个歌单生成器。这块更偏个性化一点。它会去扫你本地的音乐应用,像 Apple Music、QQ音乐、Spotify、网易云音乐 这些都可以接。
核心就是先分析你的听歌习惯,比如风格偏好、情绪倾向这些,然后再结合你给的主题,自动帮你规划一套歌单。一般是一组 3 到 7 首歌,不是简单拼接,而是有顺序、有起伏的。
我这边就让它扫了一下我的 Apple Music,然后给了一个主题,让它去生成一套看看效果。
根据我的口味生成每日通行歌曲
你能看到,它会先把我本地能拿到的音乐内容都扫一遍。比如我这边的 Apple Music 里有 158 首歌,另外还有 QQ 音乐、网易云音乐,以及我之前生成过的一些 AI 音乐历史,它都能一起纳入分析。

它会先把你的口味画像分析出来,然后再一首一首往下生成。每首歌生成完,你还可以直接打分、给反馈,后面的歌会继续顺着你的反馈去调。

然后它会把整套流程继续往下跑。一首一首去生成歌词,Prompt 也是它自己拆、自己写的。整套歌单不是只给你规划,而是真的会逐首生成出来,最后统一存到本地。
到这一步,其实就已经是可用状态了。但你还可以再往前走一步做魔改。比如在生成完成之后,直接把这些歌导入到 Apple Music 里,省掉手动整理这一步:

下面这就是它最终生成的 5 首不同风格的通勤路上的歌曲:

我这边随便挑了一首男声版本,可以听一下整体效果,风格上能听出一点 J-POP 融合的感觉,旋律走向和编曲都比较轻,节奏也不压:
还有一个我觉得比较有意思的点,是它在执行过程中其实有时间戳的概念。
比如我在 4 月 7 号让它去扫,在扫描和整理之后,会盖上一个时间戳,等于会基于一个明确的时间范围去整理和判断。
所以,你完全可以继续往下魔改,让它变成每天自动扫描一次,上一个时间戳和现在之间的这段时间里,如果你存进了新的歌,或者就是自己收藏的歌手新发布的歌,都可以让它只针对这段时间内的新增歌曲,进一步调整偏好,而且实现不难。
再进一步的话,甚至可以直接接进 OpenClaw,做成全自动流程:每天扫一遍、每天生成新歌、每天自动存进你自己的本地歌单,或者直接同步到网易云、Apple Music 这种音乐库里。
第三个 Skill 是 Buddy-sings(宠物歌手) 这个比较有趣味性。如果你在 Claude Code 里设置了宠物(/pets 功能),这个 Skill 会读取宠物的名字和个性,给它生成一个专属的声音身份,音色、演唱风格、情绪都会根据宠物性格来定。然后它就可以用宠物的视角来创作和演唱歌曲。这个 Skill 的彩蛋就很多了,欢迎大家去试玩一下。
当然你也可以根据自己的需求去搓完全不同方向的 Skill。比如一个「短视频 BGM 流水线」,输入视频脚本或画面描述,按情绪段落批量生成配乐。或者一个「歌曲变体工厂」,输入一首歌,用 Cover 批量跑出好几种风格变体。
工具和 API 都是现成的,能搓出什么样的 Skill,完全看你自己的需求。
🚥
越来越多的 AI 产品在走 CLI 化和 Agent 化的路线。
以前用 AI 工具的链路在变短,在终端里一句话调用,或者让 Agent 在工作流里自动触发,你甚至不需要离开正在工作的环境。
Music 2.6 这次更新也在往这个方向前进。模型升级和 Cover 是能力层面的事,Music Skills 做的则是把这些能力包装成模块,让你可以嵌进自己的工作流里。
目前 MiniMax 在做限时免费,C 端网页每天 500 首生成额度,API 用户也有每天 100 首的免费量,进入门槛很低。
有兴趣的话可以去上手试试,直接在 MiniMax Audio 网页端体验也行,通过 API 接进 Agent 里也行。想折腾的话,可以在 Claude Code 里搓一个自己的 Skill,也是一种玩法。

十字路口正在寻找独立撰稿人,撰写 AI 产品和模型评测。
如果你写过类似文章:《实测 PixVerse C1》、《实测 LibTV》,请联系 zeo0811@gmail.com ,邮件内容请包括:① 个人介绍、② 你写过的 AI 评测文章。
我们会提供有竞争力的稿酬。期待与你一起观察与记录 AI 时代 🎪
