Descrivi una canzone, ascoltala: il text-to-song in pratica

TL;DR

Il text-to-song trasforma una frase in un brano finito — arrangiamento, strumentazione e voci, se le vuoi. La frase deve contenere genere, atmosfera e un soggetto concreto; «fallo allegro» non dà al modello nulla su cui costruire. Al primo tentativo lascia i controlli musicali su Auto, poi usali per spostare una cosa. In Musy AI la descrizione arriva a 150 caratteri e quasi tutte le canzoni sono pronte in circa un minuto.

La frase è tutto lo strumento

Ogni buon risultato che abbiamo ottenuto contiene tre ingredienti, e a quasi tutti i risultati mediocri ne manca uno:

Messo insieme: «Un beat lo-fi per una notte di pioggia a Tokyo» — genere, atmosfera, scena, dodici parole. È la forma da copiare.

La schermata di creazione di Musy AI su iPhone con il campo della descrizione della canzone e i controlli facoltativi di genere, atmosfera, BPM e durata.
Prima la descrizione. Ogni controllo musicale sotto è facoltativo e parte da Auto.

All’inizio lascia stare i controlli

Genere, atmosfera, BPM e durata si possono impostare esplicitamente, e l’istinto è impostarli tutti subito. Resisti. Se la tua descrizione dice «una notte di pioggia a Tokyo» e imposti anche il genere su Metal, hai chiesto due canzoni diverse e otterrai la loro media.

I controlli si guadagnano il loro posto al secondo passaggio, quando hai un risultato che ci va vicino: stessa descrizione, BPM abbassato di poco, atmosfera impostata esplicitamente, rigenera. Quello è un esperimento controllato. Impostare sei cose insieme non lo è.

ControlloLascia su Auto quando…Impostalo quando…
GenereLa tua descrizione nomina già un suonoVuoi uno dei 29 in particolare e il testo è ambiguo
AtmosferaLa descrizione porta con sé un’emozioneIl risultato è tornato emotivamente piatto
BPMQuasi sempreIl brano serve per qualcosa a tempo — un allenamento, un montaggio video
DurataMai — questa scegliila di propositoSempre. Cambia la struttura, non solo la lunghezza.

Strumentale o cantata

Lo strumentale è il valore predefinito più sicuro per tutto ciò sotto cui la canzone si posiziona: un video, la sigla di un podcast, un ascolto di sottofondo. Le voci sono il punto quando la canzone è la cosa in sé, o quando parla di qualcuno.

Con il testo attivo puoi scriverlo tu (fino a 500 caratteri) oppure farlo generare dalla stessa descrizione. Scriverlo tu vale la pena quando contano i dettagli: un nome, una battuta privata, un luogo. I testi generati sono migliori di quanto ci si aspetti nel pastiche di genere e peggiori nel voler dire qualcosa di preciso.

Le voci si possono impostare su Auto, maschile, femminile o di bambino. Puoi anche registrare la tua voce una volta nell’app e far cantare le canzoni con quella. È volutamente limitato alla tua voce: non costruiamo la clonazione della voce di altre persone, e consigliamo la stessa cautela ovunque tu trovi questa funzione.

Perché il primo risultato non è quello che tieni

La generazione ha una varianza reale: la stessa descrizione due volte ti dà due canzoni diverse, entrambe valide. Non è un difetto da aggirare con il prompt, è il mezzo. Il flusso di lavoro che funziona:

  1. Scrivi la frase a tre ingredienti. Scegli una durata. Genera.
  2. Ascolta una volta, fino in fondo. Decidi che cosa non va di preciso: tempo, energia, strumentazione, voce.
  3. Se non c’è niente di preciso che non va ma è spenta, rigenera senza cambiare nulla. Spesso basta la varianza a sistemarla.
  4. Se c’è qualcosa di preciso che non va, cambia quella sola cosa e rigenera.
  5. Tieni quelle buone. Generare costa poco; decidere è la parte lenta.

Quando conviene partire da un modello

Per le canzoni d’occasione — compleanni, canzoni d’amore, canzoni su un animale — i modelli del Lab impostano genere e atmosfera per te e chiedono solo quello che quell’occasione deve sapere. È una strada più rapida che scrivere una descrizione da zero, e di solito è anche migliore, perché il modello sa già cosa fa funzionare quel tipo di canzone. Guarda la guida alla canzone di compleanno per vedere quel flusso dall’inizio alla fine.

Una volta che hai un brano che ti piace, la tana del bianconiglio sulla scrittura dei prompt è in prompt per canzoni che funzionano.

Domande frequenti

Come funziona il text-to-song con l’IA?

Tu descrivi la canzone; il modello la compone e la esegue, restituendo un audio finito. In Musy AI la descrizione arriva a 150 caratteri, la generazione va in background e quasi tutte le canzoni richiedono circa un minuto.

Cosa deve dire la descrizione?

Genere o suono di riferimento, atmosfera e un soggetto concreto. «Un beat lo-fi per una notte di pioggia a Tokyo» li contiene tutti e tre.

Devo impostare a mano genere, atmosfera e BPM?

Non al primo tentativo: i controlli che contraddicono il testo tirano il risultato da due parti. Usali per spostare una cosa precisa al secondo passaggio.

Quanto può durare una canzone IA?

30 secondi, 60, 90 oppure 2 minuti. Spesso più corta è meglio: una sola idea forte batte due minuti di ripetizioni.