Grok ভিডিও তৈরি: প্রম্পট থেকে ছোট ক্লিপ কীভাবে বানাবেন

TL;DR

Grok-এর ভিডিও মডেল একটি বাক্য — বা একটি ছবি — কে ১৫ সেকেন্ড পর্যন্ত ছোট ক্লিপে বদলে দেয়। GO AI Chat-এ এটি Lab ট্যাবে ছবি তৈরির পাশেই থাকে, তাই আলাদা অ্যাপের টাকা দিতে হয় না। যে প্রম্পট-ছাঁচ কাজ করে তা একঘেয়ে আর নির্ভরযোগ্য: একটি বিষয়, একটি ক্রিয়া, একটি ক্যামেরার নড়াচড়া, একটি ধরন। বাকি সবটাই হেরফের সামলানো।

Grok ভিডিও আসলে কী

এটি xAI-এর লেখা-থেকে-ভিডিও ও ছবি-থেকে-ভিডিও মডেল। আপনি একটি বর্ণনা বা স্থিরচিত্র দেন; এটি কৃত্রিম নড়াচড়াসহ একটি ছোট ক্লিপ ফেরত দেয়। এটি সম্পাদক নয়, স্টক লাইব্রেরি নয়, আর দুই মিনিটের দৃশ্য বানানোর হাতিয়ারও নয়। একে শট বানানোর যন্ত্র ধরা — একটি মুহূর্ত, কয়েক সেকেন্ডের — সেই মানসিক ছাঁচই ব্যবহারযোগ্য ফল দেয়।

একই অন্তর্নিহিত সক্ষমতা কয়েক জায়গায় ভিডিও তৈরি চালায়, X-সহ। পার্থক্য চারপাশের প্রেক্ষাপটে: GO AI Chat-এ ক্লিপটি ফিডে নয়, আপনার ছবির অ্যালবামে নামে, আর আপনি এমনিতেই সেই অ্যাপে আছেন যেখানে লেখেন, খোঁজেন আর ছবি বানান।

আইফোনে GO AI Chat-এর Lab ট্যাব, যাতে Image Creator, Image Transformer আর Video Generator আছে।
ভিডিও তৈরি Lab-এ, ছবি-সরঞ্জামের ঠিক পাশে।

প্রম্পটের ছাঁচ

আমাদের ক্ষেত্রে যত নড়াচড়ার প্রম্পট কাজ করেছে, সবগুলোর একই চারটি অংশ। একটি বাদ দিলে মডেল সেটি নিজে বানায়, সাধারণত খারাপভাবে।

একসঙ্গে: "হলুদ রেইনকোট পরা এক নারী নিয়ন-আলোকিত বৃষ্টির মধ্যে দিয়ে ক্যামেরার দিকে হাঁটছে, ধীরে এগিয়ে যাওয়া, ৩৫ মিমিতে তোলা, অগভীর গভীরতা।" এটি শট-তালিকার মতো পড়ায়, কারণ এটি তাই।

দৈর্ঘ্য, আকার আর মান

তিনটি সেটিং গুরুত্বপূর্ণ, আর সেগুলো খরচের সঙ্গে জড়ানো — লম্বা ও উচ্চমানের ক্লিপ আপনার টোকেন-ভাণ্ডার বেশি খায়, তাই সবসময় সর্বোচ্চে না রেখে বুঝে বাছা ভালো।

সেটিংকী বাছবেনকেন
সময়কালবেশির ভাগ ক্ষেত্রে ৫–৮ সেকেন্ড; নড়াচড়ার দরকার হলে তবেই ১৫লম্বা ক্লিপ বেশি ভেসে যায়। আঁটসাঁট ৬ সেকেন্ড এলোমেলো ১৫-কে হারায়।
অনুপাতReels/TikTok/Shorts-এ ৯:১৬, ল্যান্ডস্কেপে ১৬:৯যে আকারে প্রকাশ করবেন সেই আকারেই বানান — পরে কাটলে রেজোলিউশন যায় আর শটটি খারাপভাবে নতুন করে সাজে।
মানপ্রম্পট ঘষামাজার সময় নিচু ধাপ; চূড়ান্তটির জন্য বাড়ানরান খরচ হয় প্রম্পট খোঁজায়। সেটা পুরো মানে খরচ করবেন না।

ছবি-থেকে-ভিডিও: কম মূল্যায়িত পথ

ছবি থেকে শুরু করলে কাজের সবচেয়ে কঠিন অংশটাই সরে যায় — মডেলকে আর ভাবতে হয় না জিনিসগুলো দেখতে কেমন, কেবল ভাবতে হয় কীভাবে নড়ে। এজন্যই একই ভাবনা থেকে ছবি-থেকে-ভিডিওর ফল প্রায়ই লেখা-থেকে-ভিডিওর চেয়ে বেশি সংগত হয়।

সাফল্য যে নিয়মে ঠিক হয়: স্থিরচিত্রটিকে একটিমাত্র যুক্তিসংগত নড়াচড়ার ইঙ্গিত দিতে হবে। খোলা চুলের প্রতিকৃতি হাওয়ার ইঙ্গিত দেয়। এক কাপ কফি ধোঁয়ার। দাঁড়িয়ে থাকা গাড়ি কিছুরই ইঙ্গিত দেয় না, আর মডেল তখন কিছু একটা বানিয়ে নেবে। কী নড়বে তা পাঁচ শব্দে বলতে না পারলে অন্য ছবি বাছুন।

যে কাজে এটি সত্যিই খারাপ

সীমা নিয়ে নির্দিষ্ট হওয়া সুবিধার তালিকার চেয়ে বেশি কাজের:

যে কর্মপ্রবাহে রান কম নষ্ট হয়

  1. চার অংশের প্রম্পট লিখুন। আবার পড়ে দ্বিতীয় ক্রিয়াপদটি মুছে দিন।
  2. নিচু মান আর ছোট সময়কালে একবার বানান।
  3. ৮০% ঠিক হলে একই প্রম্পট আবার চালান — কেবল হেরফেরই প্রায়ই ঠিক করে দেয়।
  4. নির্দিষ্ট কোনো দিকে ভুল হলে প্রম্পটের ঠিক একটি অংশ বদলান। তিনটি বদলালে কিছুই জানা যায় না।
  5. শট ঠিক হলে যে মান ও দৈর্ঘ্য আসলে চান তাতে আবার চালান।

বোতাম কোথায় সেটুকুসহ পূর্ণ ধাপে ধাপে সংস্করণ আছে আমাদের আইফোন ভিডিও নির্দেশিকায়। ভিডিও ছাড়া বাকি সব বিষয়ে Grok আর GPT-5-এর তুলনা দেখতে Grok 4 বনাম GPT-5

সাধারণ প্রশ্ন

ভিডিও কত লম্বা হতে পারে?

সর্বোচ্চ ১৫ সেকেন্ড — নির্বাচকের সীমা। লম্বা হলে সংগতি কমে, তাই মডেলগুলো সীমা বাঁধে।

আগের ছবি নড়াতে পারে?

হ্যাঁ — ছবি-থেকে-ভিডিও। স্থিরচিত্র একটিমাত্র যুক্তিসংগত নড়াচড়ার ইঙ্গিত দিলে সবচেয়ে ভালো।

প্রম্পট থেকে আলাদা হলো কেন?

প্রতিবারের চালে হেরফের হয়। মোটামুটি ঠিক থাকলে একই প্রম্পট আরেকবার চালান।

আলাদা অ্যাপ লাগে?

না। GO AI Chat একই অ্যাপে Grok দিয়ে ভিডিও চালায়, ফল সরাসরি অ্যালবামে যায়।