用一句话生成一首歌

TL;DR

文字生成歌曲能把一句话变成一首完整的曲子——编曲、配器,你想要的话还有人声。这句话必须带上曲风、情绪和一个具体主题;「做得开心一点」等于什么也没给模型。第一次尝试时把音乐控件全都留在「自动」,之后再用它们去移动一件事。在 Musy AI 里,描述最多 150 个字符,多数歌曲一分钟左右就好了。

那句话就是整件乐器

我们得到过的每个好结果,都含有三样成分;而多数糟糕的结果,都少了其中一样:

拼起来:「一段配东京雨夜的 lo-fi 节奏」——曲风、情绪、场景,十几个字。这就是可以照抄的形状。

iPhone 上 Musy AI 的创作界面,含歌曲描述输入框,以及可选的曲风、情绪、BPM 和时长控件。
先写描述。它下面的每一个音乐控件都是可选的,默认为「自动」。

一开始别碰那些控件

曲风、情绪、BPM 和时长都能显式设置,而人的本能是一上来就全设一遍。忍住。如果你的描述写着「东京的一个雨夜」,而你又把曲风设成金属,那你就是要了两首不同的歌,你会拿到它们的平均值。

这些控件是在第二轮才配得上位置的:当你已经有了一个接近的结果时——同样的描述,BPM 往下挪一点,情绪显式指定,重新生成。那是一次受控实验。一次设六样,不是。

控件什么时候留在自动什么时候去设它
曲风你的描述里已经点名了一种声音你想要 29 种里的某一种,而文字含糊
情绪描述本身带着情感结果回来时情感很平
BPM几乎总是这首曲子有时间约束——健身、剪视频
时长永远别自动——这个要有意识地挑每次都设。它改变的是结构,不只是长度。

纯音乐还是人声

凡是这首歌要垫在别的东西下面的场合——视频、播客片头、背景聆听——纯音乐是更稳妥的默认。当这首歌本身就是主角,或者它是关于某个人的,人声才是重点。

打开歌词后,你可以自己写(最多 500 个字符),也可以让它从同一段描述生成。当具体细节重要时——一个名字、一个只有你们懂的梗、一个地方——自己写是值得的。生成的歌词在模仿曲风套路上比多数人预期的要好,在真正表达什么意思上则比预期的要差。

人声可以设为自动、男声、女声或童声。你也可以在应用里录一次自己的声音,让歌曲用它来唱。这个功能被刻意限定在你自己的声音上——我们不做他人声音的克隆,也建议你在任何地方看到这类功能时都保持同样的谨慎。

为什么第一版通常不是最终版

生成存在真实的随机差异:同一段描述跑两次会给你两首不同的歌,而且都成立。这不是需要靠提示词绕开的缺陷,这就是这个媒介本身。管用的流程是:

  1. 写出三成分的那句话。挑一个时长。生成。
  2. 完整听一遍。想清楚具体哪里不对——速度、能量、配器,还是人声。
  3. 如果没有哪里具体不对、就是平淡,那就原样重新生成。光靠随机差异往往就能修好。
  4. 如果某个具体的地方不对,就只改那一件事,然后重新生成。
  5. 好的都留着。生成很便宜;慢的那一步是做决定。

什么时候该改从模板开始

对于场合类歌曲——生日、情歌、写给宠物的歌——Lab 的模板会替你设好曲风和情绪,只问那个场合真正需要知道的事。这比从零写一段描述更快,而且通常更好,因为模板已经知道这类歌怎么写才成立。这个流程从头到尾是什么样,见 生日歌操作指南。

等你做出一首满意的曲子之后,提示词写法的那个兔子洞在 管用的歌曲提示词。

常见问题

文字生成歌曲怎么运作?

你描述,模型作曲并演奏,返回成品音频。描述最多 150 个字符,多数歌曲一分钟左右。

描述该写什么?

曲风或参照音色、情绪,以及一个具体主题。「一段配东京雨夜的 lo-fi 节奏」三样都有。

要手动设曲风、情绪和 BPM 吗?

第一次别设——和文字矛盾的控件会把结果拉向两边。第二轮再用它们动一件具体的事。

歌曲能有多长?

30 秒、60、90 或 2 分钟。往往越短越好。