একটি বাক্য থেকে গান বানানো

TL;DR

লেখা-থেকে-গান একটি বাক্যকে সম্পূর্ণ একটি ট্র্যাকে বদলে দেয় — সাজানো, বাদ্যযন্ত্র, আর চাইলে কণ্ঠও। বাক্যটিকে বইতে হবে ধরন, মেজাজ আর একটি মূর্ত বিষয়; "আনন্দময় করো" মডেলকে গড়ার মতো কিছুই দেয় না। প্রথম চেষ্টায় সংগীতের নিয়ন্ত্রণগুলো স্বয়ংক্রিয়তেই রাখুন, তারপর সেগুলো দিয়ে একটি জিনিস নাড়ান। Musy AI-তে বর্ণনা সর্বোচ্চ ১৫০ অক্ষরের আর বেশির ভাগ গান মিনিটখানেকে তৈরি।

বাক্যটিই গোটা যন্ত্র

আমাদের পাওয়া প্রতিটি ভালো ফলে তিনটি উপাদান ছিল, আর বেশির ভাগ খারাপ ফলে একটি অনুপস্থিত:

জোড়া লাগিয়ে: "টোকিওর বৃষ্টিভেজা রাতের জন্য একটি লো-ফাই বিট" — ধরন, মেজাজ, দৃশ্য, গোটা বারো শব্দ। এই ছাঁচটাই নকল করার।

আইফোনে Musy AI-এর তৈরির পর্দা, গানের বর্ণনার ঘর আর ঐচ্ছিক ধরন, মেজাজ, BPM ও সময়কালের নিয়ন্ত্রণসহ।
আগে বর্ণনা। তার নিচের প্রতিটি সংগীত-নিয়ন্ত্রণ ঐচ্ছিক আর স্বয়ংক্রিয়তে থাকে।

প্রথমে নিয়ন্ত্রণগুলো ছুঁবেন না

ধরন, মেজাজ, BPM আর সময়কাল সবই স্পষ্ট করে ঠিক করা যায়, আর সহজাত প্রবৃত্তি হলো সঙ্গে সঙ্গে সবকটাই ঠিক করে দেওয়া। ঠেকান নিজেকে। আপনার বর্ণনায় যদি থাকে "টোকিওর একটি বৃষ্টিভেজা রাত" আর ধরনও যদি মেটাল করে দেন, তবে আপনি দুটি আলাদা গান চেয়েছেন আর তাদের গড়টাই পাবেন।

নিয়ন্ত্রণগুলো নিজের জায়গা অর্জন করে দ্বিতীয় দফায়, যখন হাতে কাছাকাছি একটি ফল আছে: একই বর্ণনা, BPM একটু নামানো, মেজাজ স্পষ্ট করে দেওয়া, আবার তৈরি। সেটি নিয়ন্ত্রিত পরীক্ষা। একসঙ্গে ছয়টি ঠিক করা নয়।

নিয়ন্ত্রণস্বয়ংক্রিয় রাখুন যখন…ঠিক করে দিন যখন…
ধরনবর্ণনায় ইতিমধ্যেই একটি শব্দের নাম আছে২৯টির মধ্যে নির্দিষ্ট একটি চান আর লেখা অস্পষ্ট
মেজাজবর্ণনাই অনুভূতি বইছেফল ফিরল অনুভূতিহীন হয়ে
BPMপ্রায় সবসময়ট্র্যাকটি সময়-বাঁধা কিছুর জন্য — ব্যায়াম, ভিডিও সম্পাদনা
সময়কালকখনো নয় — এটি বুঝে বাছুনসবসময়। এটি কেবল দৈর্ঘ্য নয়, গঠনই বদলে দেয়।

যন্ত্রসংগীত না কণ্ঠ

গান যেখানে অন্য কিছুর নিচে বসে — ভিডিও, পডকাস্টের সূচনা, পটভূমির শ্রবণ — সেখানে যন্ত্রসংগীতই নিরাপদ ডিফল্ট। কণ্ঠ তখনই মূল কথা যখন গানটিই আসল জিনিস, বা যখন এটি কাউকে নিয়ে।

কথা চালু করলে নিজে লিখতে পারেন (সর্বোচ্চ ৫০০ অক্ষর) কিংবা একই বর্ণনা থেকে তৈরি করিয়ে নিতে পারেন। নির্দিষ্ট বিষয় গুরুত্বপূর্ণ হলে — একটি নাম, ঘরোয়া কোনো রসিকতা, একটি জায়গা — নিজে লেখাই ভালো। তৈরি কথা ধরনের নকল করায় বেশির ভাগের প্রত্যাশার চেয়ে ভালো, আর নির্দিষ্ট কিছু বোঝানোয় প্রত্যাশার চেয়ে খারাপ।

কণ্ঠ স্বয়ংক্রিয়, পুরুষ, নারী বা শিশু করা যায়। অ্যাপে একবার নিজের কণ্ঠ রেকর্ড করে সেই কণ্ঠে গানও গাওয়ানো যায়। এটি ইচ্ছে করেই আপনার নিজের কণ্ঠেই সীমিত — আমরা অন্যের কণ্ঠ নকল করার সুবিধা বানাই না, আর যেখানেই এমন সুবিধা পান সেখানেই একই সতর্কতা রাখতে বলব।

প্রথম ফলটিই রেখে দেওয়ার মতো নয় কেন

তৈরিতে সত্যিকারের হেরফের আছে: একই বর্ণনা দুবার দিলে দুটি আলাদা গান পাবেন, দুটোই বৈধ। এটি প্রম্পট দিয়ে এড়ানোর মতো ত্রুটি নয়, এটাই এই মাধ্যম। যে কর্মপ্রবাহ কাজ করে:

  1. তিন উপাদানের বাক্যটি লিখুন। একটি সময়কাল বাছুন। বানান।
  2. একবার পুরোটা শুনুন। ঠিক কী ভুল তা ঠিক করুন — গতি, শক্তি, বাদ্যযন্ত্র, না কণ্ঠ।
  3. নির্দিষ্ট কিছু ভুল নয় অথচ নিষ্প্রাণ লাগলে, না বদলে আবার বানান। কেবল হেরফেরই প্রায়ই ঠিক করে দেয়।
  4. নির্দিষ্ট কিছু ভুল হলে, সেই একটিই বদলে আবার বানান।
  5. ভালোগুলো রেখে দিন। বানানো সস্তা; ধীর অংশটা হলো সিদ্ধান্ত নেওয়া।

কখন বরং টেমপ্লেট থেকে শুরু করবেন

উপলক্ষের গানে — জন্মদিন, প্রেমের গান, পোষা প্রাণীকে নিয়ে গান — Lab-এর টেমপ্লেট আপনার হয়ে ধরন আর মেজাজ ঠিক করে দেয় আর কেবল সেটুকুই জিজ্ঞেস করে যা ওই উপলক্ষের জানা দরকার। শূন্য থেকে বর্ণনা লেখার চেয়ে এটি দ্রুততর পথ, আর সাধারণত ভালোও, কারণ টেমপ্লেট আগে থেকেই জানে ওই ধরনের গান কীসে দাঁড়ায়। পুরো প্রবাহটি কেমন, দেখুন জন্মদিনের গানের নির্দেশিকায়।

পছন্দসই একটি ট্র্যাক পেয়ে গেলে প্রম্পট-শিল্পের গভীর গর্তটি আছে যেসব গানের প্রম্পট কাজ করে-তে।

সাধারণ প্রশ্ন

লেখা-থেকে-গান কীভাবে চলে?

আপনি বর্ণনা দেন, মডেল সুর বেঁধে গেয়ে তৈরি অডিও ফেরত দেয়। বর্ণনা সর্বোচ্চ ১৫০ অক্ষর।

বর্ণনায় কী থাকবে?

ধরন বা রেফারেন্স শব্দ, মেজাজ, আর একটি মূর্ত বিষয়।

হাতে ঠিক করব?

প্রথম চেষ্টায় নয়। দ্বিতীয় দফায় একটিমাত্র জিনিস নাড়াতে ব্যবহার করুন।

কত লম্বা হতে পারে?

৩০ সেকেন্ড, ৬০, ৯০, বা ২ মিনিট। ছোটই প্রায়ই ভালো।