Describe una canción y escúchala: texto a canción en la práctica

TL;DR

El texto a canción convierte una frase en una pista terminada: arreglo, instrumentación y voces si las quieres. La frase tiene que llevar género, ánimo y un tema concreto; «que sea alegre» no le da al modelo nada sobre lo que construir. Deja los controles musicales en automático en el primer intento y luego úsalos para mover una cosa. En Musy AI la descripción admite hasta 150 caracteres y la mayoría de las canciones están listas en torno a un minuto.

La frase es todo el instrumento

Todos los buenos resultados que hemos tenido llevan tres ingredientes, y a la mayoría de los malos les falta uno:

Montado: «Un beat lo-fi para una noche de lluvia en Tokio»: género, ánimo, escena, doce palabras. Esa es la forma que hay que copiar.

Pantalla de creación de Musy AI en el iPhone con el campo de descripción de la canción y los controles opcionales de género, ánimo, BPM y duración.
Primero la descripción. Todos los controles musicales de debajo son opcionales y vienen en automático.

Al principio, no toques los controles

Género, ánimo, BPM y duración se pueden fijar de forma explícita, y el instinto es fijarlos todos de golpe. Resístete. Si tu descripción dice «una noche de lluvia en Tokio» y además pones el género en Metal, has pedido dos canciones distintas y obtendrás el promedio de las dos.

Los controles se ganan su sitio en la segunda pasada, cuando tienes un resultado que está cerca: misma descripción, BPM un poco más bajo, ánimo fijado explícitamente, regenerar. Eso es un experimento controlado. Cambiar seis cosas a la vez, no.

ControlDéjalo en automático cuando…Fíjalo cuando…
GéneroTu descripción ya nombra un sonidoQuieres uno concreto de los 29 y el texto es ambiguo
ÁnimoLa descripción ya lleva emociónEl resultado salió emocionalmente plano
BPMCasi siempreLa pista es para algo con tiempo fijo: un entrenamiento, un montaje de vídeo
DuraciónNunca: elígela a propósitoSiempre. Cambia la estructura, no solo la longitud.

Instrumental o con voz

Instrumental es la opción más segura para todo aquello bajo lo que va la canción: un vídeo, una sintonía de pódcast, escucha de fondo. Las voces son el punto cuando la canción es la protagonista, o cuando va sobre alguien.

Con las letras activadas puedes escribir las tuyas (hasta 500 caracteres) o generarlas a partir de la misma descripción. Escribirlas tú merece la pena cuando importan los detalles: un nombre, un chiste privado, un lugar. Las letras generadas son mejores de lo que la gente espera imitando las convenciones del género, y peores a la hora de significar algo en particular.

Las voces se pueden poner en automático, masculina, femenina o infantil. También puedes grabar tu propia voz una vez en la app y que las canciones se canten con ella. Eso está deliberadamente acotado a tu voz: no construimos clonación de voces de otras personas, y recomendaríamos la misma cautela allá donde encuentres esa función.

Por qué el primer resultado no es el que te quedas

La generación tiene variabilidad real: la misma descripción dos veces te da dos canciones distintas, ambas válidas. Eso no es un defecto que haya que esquivar con prompts, es el medio. El flujo que funciona:

  1. Escribe la frase de tres ingredientes. Elige una duración. Genera.
  2. Escúchala una vez, entera. Decide qué está mal concretamente: tempo, energía, instrumentación, voz.
  3. Si nada está mal en concreto pero resulta sosa, regenera sin cambiar nada. La variabilidad sola suele arreglarlo.
  4. Si algo concreto está mal, cambia esa sola cosa y regenera.
  5. Quédate con las buenas. Generar es barato; decidir es la parte lenta.

Cuándo partir de una plantilla

Para canciones de ocasión —cumpleaños, canciones de amor, canciones sobre una mascota— las plantillas del Lab fijan el género y el ánimo por ti y solo preguntan lo que esa ocasión necesita saber. Es una vía más rápida que escribir una descripción desde cero, y normalmente mejor, porque la plantilla ya sabe qué hace que ese tipo de canción funcione. Mira el recorrido de la canción de cumpleaños para verlo de principio a fin.

Cuando ya tengas una pista que te guste, la madriguera del oficio de escribir prompts está en prompts de canciones que funcionan.

Preguntas frecuentes

¿Cómo funciona el texto a canción?

Describes la canción; el modelo la compone y la interpreta, y devuelve audio terminado. En Musy AI la descripción admite 150 caracteres, la generación corre en segundo plano y la mayoría tarda en torno a un minuto.

¿Qué debería decir la descripción?

Género o sonido de referencia, ánimo y un tema concreto. «Un beat lo-fi para una noche de lluvia en Tokio» lleva los tres.

¿Fijo género, ánimo y BPM a mano?

En el primer intento no: los controles que contradicen tu texto tiran del resultado en dos direcciones. Úsalos en la segunda pasada para mover una cosa concreta.

¿Cuánto puede durar?

30 segundos, 60, 90 o 2 minutos. Lo corto suele ser mejor: una idea fuerte gana a dos minutos de repetición.