Describe una canción y escúchala: texto a canción en la práctica
El texto a canción convierte una frase en una pista terminada: arreglo, instrumentación y voces si las quieres. La frase tiene que llevar género, ánimo y un tema concreto; «que sea alegre» no le da al modelo nada sobre lo que construir. Deja los controles musicales en automático en el primer intento y luego úsalos para mover una cosa. En Musy AI la descripción admite hasta 150 caracteres y la mayoría de las canciones están listas en torno a un minuto.
La frase es todo el instrumento
Todos los buenos resultados que hemos tenido llevan tres ingredientes, y a la mayoría de los malos les falta uno:
- Un sonido al que apuntar: un género, una época o un instrumento. «Lo-fi», «rock alternativo de los 90», «piano solo», «afrobeat».
- Un estado de ánimo: la temperatura emocional. «Melancólico», «triunfal», «amenazante», «cálido».
- Un tema o una escena: algo concreto. Este es el ingrediente que la gente se salta, y es el que marca la diferencia. «Una noche de lluvia en Tokio» es una escena; «buen rollo» no.
Montado: «Un beat lo-fi para una noche de lluvia en Tokio»: género, ánimo, escena, doce palabras. Esa es la forma que hay que copiar.
Al principio, no toques los controles
Género, ánimo, BPM y duración se pueden fijar de forma explícita, y el instinto es fijarlos todos de golpe. Resístete. Si tu descripción dice «una noche de lluvia en Tokio» y además pones el género en Metal, has pedido dos canciones distintas y obtendrás el promedio de las dos.
Los controles se ganan su sitio en la segunda pasada, cuando tienes un resultado que está cerca: misma descripción, BPM un poco más bajo, ánimo fijado explícitamente, regenerar. Eso es un experimento controlado. Cambiar seis cosas a la vez, no.
| Control | Déjalo en automático cuando… | Fíjalo cuando… |
|---|---|---|
| Género | Tu descripción ya nombra un sonido | Quieres uno concreto de los 29 y el texto es ambiguo |
| Ánimo | La descripción ya lleva emoción | El resultado salió emocionalmente plano |
| BPM | Casi siempre | La pista es para algo con tiempo fijo: un entrenamiento, un montaje de vídeo |
| Duración | Nunca: elígela a propósito | Siempre. Cambia la estructura, no solo la longitud. |
Instrumental o con voz
Instrumental es la opción más segura para todo aquello bajo lo que va la canción: un vídeo, una sintonía de pódcast, escucha de fondo. Las voces son el punto cuando la canción es la protagonista, o cuando va sobre alguien.
Con las letras activadas puedes escribir las tuyas (hasta 500 caracteres) o generarlas a partir de la misma descripción. Escribirlas tú merece la pena cuando importan los detalles: un nombre, un chiste privado, un lugar. Las letras generadas son mejores de lo que la gente espera imitando las convenciones del género, y peores a la hora de significar algo en particular.
Las voces se pueden poner en automático, masculina, femenina o infantil. También puedes grabar tu propia voz una vez en la app y que las canciones se canten con ella. Eso está deliberadamente acotado a tu voz: no construimos clonación de voces de otras personas, y recomendaríamos la misma cautela allá donde encuentres esa función.
Por qué el primer resultado no es el que te quedas
La generación tiene variabilidad real: la misma descripción dos veces te da dos canciones distintas, ambas válidas. Eso no es un defecto que haya que esquivar con prompts, es el medio. El flujo que funciona:
- Escribe la frase de tres ingredientes. Elige una duración. Genera.
- Escúchala una vez, entera. Decide qué está mal concretamente: tempo, energía, instrumentación, voz.
- Si nada está mal en concreto pero resulta sosa, regenera sin cambiar nada. La variabilidad sola suele arreglarlo.
- Si algo concreto está mal, cambia esa sola cosa y regenera.
- Quédate con las buenas. Generar es barato; decidir es la parte lenta.
Cuándo partir de una plantilla
Para canciones de ocasión —cumpleaños, canciones de amor, canciones sobre una mascota— las plantillas del Lab fijan el género y el ánimo por ti y solo preguntan lo que esa ocasión necesita saber. Es una vía más rápida que escribir una descripción desde cero, y normalmente mejor, porque la plantilla ya sabe qué hace que ese tipo de canción funcione. Mira el recorrido de la canción de cumpleaños para verlo de principio a fin.
Cuando ya tengas una pista que te guste, la madriguera del oficio de escribir prompts está en prompts de canciones que funcionan.
Preguntas frecuentes
¿Cómo funciona el texto a canción?
Describes la canción; el modelo la compone y la interpreta, y devuelve audio terminado. En Musy AI la descripción admite 150 caracteres, la generación corre en segundo plano y la mayoría tarda en torno a un minuto.
¿Qué debería decir la descripción?
Género o sonido de referencia, ánimo y un tema concreto. «Un beat lo-fi para una noche de lluvia en Tokio» lleva los tres.
¿Fijo género, ánimo y BPM a mano?
En el primer intento no: los controles que contradicen tu texto tiran del resultado en dos direcciones. Úsalos en la segunda pasada para mover una cosa concreta.
¿Cuánto puede durar?
30 segundos, 60, 90 o 2 minutos. Lo corto suele ser mejor: una idea fuerte gana a dos minutos de repetición.