Décrivez une chanson, écoutez-la : le texte-vers-chanson en pratique

TL;DR

Le texte-vers-chanson transforme une phrase en piste finie — arrangement, instrumentation, et chant si vous en voulez. La phrase doit porter un genre, une ambiance et un sujet concret ; « fais-la joyeuse » ne donne au modèle rien sur quoi bâtir. Laissez les réglages musicaux sur Auto à la première tentative, puis servez-vous-en pour déplacer une chose. Dans Musy AI, la description fait jusqu'à 150 caractères et la plupart des chansons sont prêtes en une minute environ.

La phrase est tout l'instrument

Tous les bons résultats que nous avons obtenus contiennent trois ingrédients, et la plupart des mauvais en manquent un :

Assemblé : « Un beat lo-fi pour une nuit pluvieuse à Tokyo » — genre, ambiance, scène, douze mots. C'est la forme à copier.

L'écran de création de Musy AI sur iPhone, avec un champ de description de chanson et des réglages optionnels de genre, ambiance, BPM et durée.
La description d'abord. Tous les réglages musicaux en dessous sont optionnels et par défaut sur Auto.

Laissez les réglages tranquilles au début

Genre, ambiance, BPM et durée peuvent tous être définis explicitement, et l'instinct pousse à tout régler d'emblée. Résistez-y. Si votre description dit « une nuit pluvieuse à Tokyo » et que vous réglez aussi le genre sur Metal, vous avez demandé deux chansons différentes et vous obtiendrez leur moyenne.

Les réglages gagnent leur place à la deuxième passe, quand vous avez un résultat proche : même description, BPM baissé d'un cran, ambiance définie explicitement, régénérer. Ça, c'est une expérience contrôlée. Régler six choses d'un coup, non.

RéglageLaissez sur Auto quand…Définissez-le quand…
GenreVotre description nomme déjà un sonVous en voulez un précis parmi les 29 et le texte est ambigu
AmbianceLa description porte une émotionLe résultat est revenu émotionnellement plat
BPMPresque toujoursLa piste sert à quelque chose de minuté — une séance de sport, un montage vidéo
DuréeJamais — choisissez-la délibérémentToujours. Elle change la structure, pas seulement la longueur.

Instrumental ou chanté

L'instrumental est le choix par défaut le plus sûr pour tout ce sous quoi la chanson se glisse — une vidéo, une intro de podcast, une écoute de fond. Le chant a du sens quand la chanson est la chose elle-même, ou quand elle parle de quelqu'un.

Avec les paroles activées, vous pouvez écrire les vôtres (jusqu'à 500 caractères) ou les faire générer à partir de la même description. Écrire les vôtres en vaut la peine quand les détails comptent — un prénom, une blague entre vous, un lieu. Les paroles générées sont meilleures qu'on ne le croit dans le pastiche de genre, et moins bonnes dès qu'il s'agit de vouloir dire quelque chose de précis.

La voix peut être réglée sur Auto, masculine, féminine ou enfantine. Vous pouvez aussi enregistrer votre propre voix une fois dans l'app et faire chanter les chansons avec elle. C'est délibérément limité à votre voix — nous ne développons pas le clonage de la voix d'autrui, et nous encourageons la même prudence partout où vous trouverez cette fonction.

Pourquoi le premier résultat n'est pas le bon

La génération a une réelle variation : la même description deux fois vous donne deux chansons différentes, toutes deux valables. Ce n'est pas un défaut à contourner par la consigne, c'est le médium. Le flux qui marche :

  1. Écrivez la phrase à trois ingrédients. Choisissez une durée. Générez.
  2. Écoutez une fois, en entier. Décidez de ce qui cloche précisément — tempo, énergie, instrumentation, voix.
  3. Si rien ne cloche précisément mais que c'est terne, régénérez sans rien changer. La variation seule suffit souvent.
  4. Si quelque chose de précis cloche, changez cette seule chose et régénérez.
  5. Gardez les bonnes. Générer coûte peu ; décider est la partie lente.

Quand partir d'un modèle à la place

Pour les chansons de circonstance — anniversaires, chansons d'amour, chansons sur un animal — les modèles du Lab règlent genre et ambiance pour vous et ne demandent que ce que l'occasion exige de savoir. C'est un chemin plus rapide que d'écrire une description de zéro, et c'est généralement un meilleur chemin, parce que le modèle sait déjà ce qui fait fonctionner ce type de chanson. Voyez le parcours de la chanson d'anniversaire pour ce flux de bout en bout.

Une fois une piste qui vous plaît obtenue, le terrier de l'art du prompt est dans les consignes de chanson qui marchent.

Questions fréquentes

Comment ça marche ?

Vous décrivez la chanson ; le modèle la compose et l'interprète, et renvoie un audio fini. Dans Musy AI, jusqu'à 150 caractères, génération en arrière-plan, environ une minute.

Que doit dire la description ?

Genre ou son de référence, ambiance, et un sujet concret. « Un beat lo-fi pour une nuit pluvieuse à Tokyo » porte les trois.

Faut-il régler genre, ambiance et BPM ?

Pas à la première tentative — des réglages qui contredisent votre texte tirent le résultat dans deux sens. Servez-vous-en à la deuxième passe pour déplacer une chose précise.

Quelle durée ?

30 secondes, 60, 90 ou 2 minutes. Plus court vaut souvent mieux : une idée forte bat deux minutes de répétition.