একটি বাক্য থেকে গান বানানো
লেখা-থেকে-গান একটি বাক্যকে সম্পূর্ণ একটি ট্র্যাকে বদলে দেয় — সাজানো, বাদ্যযন্ত্র, আর চাইলে কণ্ঠও। বাক্যটিকে বইতে হবে ধরন, মেজাজ আর একটি মূর্ত বিষয়; "আনন্দময় করো" মডেলকে গড়ার মতো কিছুই দেয় না। প্রথম চেষ্টায় সংগীতের নিয়ন্ত্রণগুলো স্বয়ংক্রিয়তেই রাখুন, তারপর সেগুলো দিয়ে একটি জিনিস নাড়ান। Musy AI-তে বর্ণনা সর্বোচ্চ ১৫০ অক্ষরের আর বেশির ভাগ গান মিনিটখানেকে তৈরি।
বাক্যটিই গোটা যন্ত্র
আমাদের পাওয়া প্রতিটি ভালো ফলে তিনটি উপাদান ছিল, আর বেশির ভাগ খারাপ ফলে একটি অনুপস্থিত:
- যে শব্দের দিকে তাক করবেন — একটি ধরন, একটি যুগ, বা একটি যন্ত্র। "লো-ফাই", "নব্বইয়ের অল্ট-রক", "একক পিয়ানো", "আফ্রোবিট"।
- একটি মেজাজ — অনুভূতির তাপমাত্রা। "বিষণ্ন", "বিজয়ী", "ভয়ংকর", "উষ্ণ"।
- একটি বিষয় বা দৃশ্য — মূর্ত কিছু। এই উপাদানটাই মানুষ বাদ দেয়, আর এটিই তফাত গড়ে। "টোকিওর একটি বৃষ্টিভেজা রাত" দৃশ্য; "চিল ভাইব" নয়।
জোড়া লাগিয়ে: "টোকিওর বৃষ্টিভেজা রাতের জন্য একটি লো-ফাই বিট" — ধরন, মেজাজ, দৃশ্য, গোটা বারো শব্দ। এই ছাঁচটাই নকল করার।
প্রথমে নিয়ন্ত্রণগুলো ছুঁবেন না
ধরন, মেজাজ, BPM আর সময়কাল সবই স্পষ্ট করে ঠিক করা যায়, আর সহজাত প্রবৃত্তি হলো সঙ্গে সঙ্গে সবকটাই ঠিক করে দেওয়া। ঠেকান নিজেকে। আপনার বর্ণনায় যদি থাকে "টোকিওর একটি বৃষ্টিভেজা রাত" আর ধরনও যদি মেটাল করে দেন, তবে আপনি দুটি আলাদা গান চেয়েছেন আর তাদের গড়টাই পাবেন।
নিয়ন্ত্রণগুলো নিজের জায়গা অর্জন করে দ্বিতীয় দফায়, যখন হাতে কাছাকাছি একটি ফল আছে: একই বর্ণনা, BPM একটু নামানো, মেজাজ স্পষ্ট করে দেওয়া, আবার তৈরি। সেটি নিয়ন্ত্রিত পরীক্ষা। একসঙ্গে ছয়টি ঠিক করা নয়।
| নিয়ন্ত্রণ | স্বয়ংক্রিয় রাখুন যখন… | ঠিক করে দিন যখন… |
|---|---|---|
| ধরন | বর্ণনায় ইতিমধ্যেই একটি শব্দের নাম আছে | ২৯টির মধ্যে নির্দিষ্ট একটি চান আর লেখা অস্পষ্ট |
| মেজাজ | বর্ণনাই অনুভূতি বইছে | ফল ফিরল অনুভূতিহীন হয়ে |
| BPM | প্রায় সবসময় | ট্র্যাকটি সময়-বাঁধা কিছুর জন্য — ব্যায়াম, ভিডিও সম্পাদনা |
| সময়কাল | কখনো নয় — এটি বুঝে বাছুন | সবসময়। এটি কেবল দৈর্ঘ্য নয়, গঠনই বদলে দেয়। |
যন্ত্রসংগীত না কণ্ঠ
গান যেখানে অন্য কিছুর নিচে বসে — ভিডিও, পডকাস্টের সূচনা, পটভূমির শ্রবণ — সেখানে যন্ত্রসংগীতই নিরাপদ ডিফল্ট। কণ্ঠ তখনই মূল কথা যখন গানটিই আসল জিনিস, বা যখন এটি কাউকে নিয়ে।
কথা চালু করলে নিজে লিখতে পারেন (সর্বোচ্চ ৫০০ অক্ষর) কিংবা একই বর্ণনা থেকে তৈরি করিয়ে নিতে পারেন। নির্দিষ্ট বিষয় গুরুত্বপূর্ণ হলে — একটি নাম, ঘরোয়া কোনো রসিকতা, একটি জায়গা — নিজে লেখাই ভালো। তৈরি কথা ধরনের নকল করায় বেশির ভাগের প্রত্যাশার চেয়ে ভালো, আর নির্দিষ্ট কিছু বোঝানোয় প্রত্যাশার চেয়ে খারাপ।
কণ্ঠ স্বয়ংক্রিয়, পুরুষ, নারী বা শিশু করা যায়। অ্যাপে একবার নিজের কণ্ঠ রেকর্ড করে সেই কণ্ঠে গানও গাওয়ানো যায়। এটি ইচ্ছে করেই আপনার নিজের কণ্ঠেই সীমিত — আমরা অন্যের কণ্ঠ নকল করার সুবিধা বানাই না, আর যেখানেই এমন সুবিধা পান সেখানেই একই সতর্কতা রাখতে বলব।
প্রথম ফলটিই রেখে দেওয়ার মতো নয় কেন
তৈরিতে সত্যিকারের হেরফের আছে: একই বর্ণনা দুবার দিলে দুটি আলাদা গান পাবেন, দুটোই বৈধ। এটি প্রম্পট দিয়ে এড়ানোর মতো ত্রুটি নয়, এটাই এই মাধ্যম। যে কর্মপ্রবাহ কাজ করে:
- তিন উপাদানের বাক্যটি লিখুন। একটি সময়কাল বাছুন। বানান।
- একবার পুরোটা শুনুন। ঠিক কী ভুল তা ঠিক করুন — গতি, শক্তি, বাদ্যযন্ত্র, না কণ্ঠ।
- নির্দিষ্ট কিছু ভুল নয় অথচ নিষ্প্রাণ লাগলে, না বদলে আবার বানান। কেবল হেরফেরই প্রায়ই ঠিক করে দেয়।
- নির্দিষ্ট কিছু ভুল হলে, সেই একটিই বদলে আবার বানান।
- ভালোগুলো রেখে দিন। বানানো সস্তা; ধীর অংশটা হলো সিদ্ধান্ত নেওয়া।
কখন বরং টেমপ্লেট থেকে শুরু করবেন
উপলক্ষের গানে — জন্মদিন, প্রেমের গান, পোষা প্রাণীকে নিয়ে গান — Lab-এর টেমপ্লেট আপনার হয়ে ধরন আর মেজাজ ঠিক করে দেয় আর কেবল সেটুকুই জিজ্ঞেস করে যা ওই উপলক্ষের জানা দরকার। শূন্য থেকে বর্ণনা লেখার চেয়ে এটি দ্রুততর পথ, আর সাধারণত ভালোও, কারণ টেমপ্লেট আগে থেকেই জানে ওই ধরনের গান কীসে দাঁড়ায়। পুরো প্রবাহটি কেমন, দেখুন জন্মদিনের গানের নির্দেশিকায়।
পছন্দসই একটি ট্র্যাক পেয়ে গেলে প্রম্পট-শিল্পের গভীর গর্তটি আছে যেসব গানের প্রম্পট কাজ করে-তে।
সাধারণ প্রশ্ন
লেখা-থেকে-গান কীভাবে চলে?
আপনি বর্ণনা দেন, মডেল সুর বেঁধে গেয়ে তৈরি অডিও ফেরত দেয়। বর্ণনা সর্বোচ্চ ১৫০ অক্ষর।
বর্ণনায় কী থাকবে?
ধরন বা রেফারেন্স শব্দ, মেজাজ, আর একটি মূর্ত বিষয়।
হাতে ঠিক করব?
প্রথম চেষ্টায় নয়। দ্বিতীয় দফায় একটিমাত্র জিনিস নাড়াতে ব্যবহার করুন।
কত লম্বা হতে পারে?
৩০ সেকেন্ড, ৬০, ৯০, বা ২ মিনিট। ছোটই প্রায়ই ভালো।