AI 生成任务

文字生成音乐:提示词怎么写出一条成品

又称 音乐生成, AI 音乐生成, text to music, t2m

文字生成音乐从一段文字描述直接产出完整音频,配器、编排、有时连人声都在一次生成里完成,而不是把各部分拼起来。模型接收风格提示词和时长,有些还单独接收歌词,让词和编排各自受控。

模型在生成什么

音乐生成模型不是在编 MIDI 再渲染音源。它直接生成音频,通常是一串学到的 token,由解码器变成波形 —— 这意味着编排、演奏和录音是一起融合出来的。你事后没法把贝斯单独关掉,因为根本没有贝斯轨,只有一段听起来像有贝斯的混音。

这一个事实就能解释大部分让人意外的行为。速度稳定,是因为模型学到了音乐有脉搏,不是因为后台跑着一个节拍器;乐器进出得合理,是因为训练数据就是这样,不是因为你编排过;而你也没法从一个从未分开过的东西里要分轨,所以分轨(stem separation)是事后独立跑的一步。

时长在音乐生成里是真实约束,不是形式。模型有一个被训练去填满的窗口,要求远超这个窗口,得到的要么是一次硬切断,要么是漂移 —— 曲子丢掉自己的调性和脉搏。

把「音乐事实」写进提示词

提示词里可靠的部分,是一个乐手能照着执行的那些;不可靠的部分,是甲方会说的那些。

  • 速度。 给数字:68 bpm。「慢」这个词会被解释成横跨三十拍的区间。
  • 调性与调式。 D minor 写上去不花钱,而且强烈塑形结果。
  • 点名乐器。 solo cellofelt pianoupright bass。点名的乐器被遵循的程度远高于流派标签。
  • 排除项。 no drumsno vocals。否定句是能拿到的最强杠杆之一,因为默认编排通常比你想要的更满。
  • 一个结构事件。 a slow felt piano entering at the halfway point 给了曲子一个去处;要求四个段落通常换来一锅粥。
  • 录音质感。 warm analogue tapeclose-miked, dry。它对混音的影响不亚于音符本身。

流派词在音乐生成里适合当起点的锚,不适合当描述,因为任何流派标签底下都盖着一堆听起来毫不相似的编排。先给一个,然后立刻用乐器和速度把它框住。

它在视频项目里的位置

多数视频活里,决定性的问题是「这段音乐要对画面做什么」,而这决定了采用哪条路。

垫在对白底下的配乐是最强的用法。要求稀疏配器、无人声、只做一次推进,然后按你成片的精确时长生成好几条。因为生成很便宜,从八条里挑一条胜过反复打磨一条。

必须卡画面的东西要难得多。模型不接受时间码,所以某一帧上的一个重音只能靠「生成得比需要的长、再剪到位」来实现。计划里应该写「修剪」,不是「靠提示词」。

带歌词的歌是那个独立歌词字段真正体现价值的场合。词写在那儿,风格提示词保持纯音乐,并且预期要为吐字重摇几次。元音比辅音撑得住,而生僻词往往是一条人声崩掉的地方。

最后一条实用提醒是响度。音乐生成出来的曲子经常贴着满刻度、几乎没有余量,所以一条单独听起来还不错的曲子,在混音里会和对白打架。把它压下来、再放到人声底下重听一遍,这是常规步骤,不是生成质量不好的信号。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Sparse cinematic score, 68 bpm in D minor, solo cello over low sustained strings, a slow felt piano entering at the halfway point, no drums, no vocals, warm analogue tape character, builds once and resolves quietly

试一下:文字生成音乐

打开生成器,参数已经预填好。

常见问题

音乐模型和音效模型有什么区别?
差在尺度和结构。音乐模型必须在几十秒里守住速度、调性和编排并保持连贯;音效模型产出的是一个几秒以内的非音乐事件,里面没有任何东西需要重复或者解决。两者训练数据不同,提示词写法也完全不同。
为什么歌词要和提示词分开填?
因为词和声音是两个问题。把歌词塞进风格提示词里,模型往往会把它当成描述性文字,然后唱别的东西。独立的歌词字段让模型能把音节对齐到它正在生成的旋律上,同时提示词继续管流派和配器。
提示词该写多具体?
音乐事实上要具体,情绪上可以松。BPM、调性、点名的乐器、以及「不要出现什么」,这几类都会被稳定遵循。像「史诗」「感人」这类形容词是提示词里最弱的部分,因为它们能对应太多互不相似的编排。
为什么出来的曲子不像真歌那样有重复段?
多数模型生成的是一段连续音频,而不是一个分段结构,所以「原样再现的副歌」不是它们天然会产出的东西。需要重复的话,先生成一段你满意的,然后在剪辑软件里安排重复,而不是在提示词里要求它。
怎么拿到干净的纯器乐?
用否定句明确要求,比如 no vocals、no vocal samples。很多模型在提示词提到任何「电影感」时会加入无词人声当织体,而点名排除比描述你想要的配器有效得多。
生成的曲子版权归谁?
这取决于服务方的条款而不是技术,而且不同模型的条款差别很大。用于任何商业或带收益的场合之前,先看清那个具体模型附带的授权,尤其是要发到会跑版权比对的平台上时。

相关术语