ساخت ویدیو

ساخت شات تازه، ادامه ویدیو و ادیت کنترل‌شده

Gemini Omni Flash برای ساخت و ادیت ویدیو چه کارهایی انجام می‌دهد؟

از متن، عکس، چند مرجع یا ویدیوی آماده شروع کنید؛ مسیر مناسب Gemini Omni Flash را انتخاب کنید و بدانید چه زمانی ادیت، Extend یا یک مدل تخصصی‌تر نتیجه بهتری می‌دهد.

قابلیت‌های ساخت و ادیت ویدیو با Gemini Omni Flash در جنارا
راهنمای انتخاب مسیر ساخت، ترکیب مرجع و ادیت ویدیو با Gemini Omni Flashطراحی اختصاصی جنارا با کمک هوش مصنوعی

پاسخ کوتاه: Gemini Omni Flash یک مدل ویدیویی چندوجهی (Multimodal) است: می‌تواند متن، تصویر، صدا و ویدیو را بفهمد و یک ویدیوی کوتاه با صدای همگام بسازد یا ویدیوی موجود را با دستور طبیعی تغییر دهد. در جنارا، قبل از انتخاب مدل، مشخص کنید می‌خواهید «شات تازه» بسازید یا «شات موجود» را اصلاح کنید؛ سپس دارایی اصلی‌تان را انتخاب کنید.

اول یک سوءتفاهم را حذف کنیم

Gemini Omni Flash چت‌بات Gemini نیست؛ یک مسیر برای ویدیوی چندمرجعی است

نام Gemini ممکن است یادآور گفت‌وگو یا تحلیل متن باشد؛ اما Gemini Omni Flash برای خروجی ویدیویی طراحی شده است. «چندوجهی» اینجا یعنی می‌توانید هم‌زمان یک دستور، تصویر محصول، ویدیوی مرجع حرکت و صدای محیط داشته باشید؛ مدل باید از آن‌ها یک شات منسجم بسازد.

این به معنی آن نیست که هر فایل را بی‌دلیل وارد کنید. هر مرجع باید فقط یک نقش اصلی داشته باشد: ظاهر محصول، سوژه، حرکت، فضا یا صدا. وقتی یک عکس را هم‌زمان برای هویت، ترکیب‌بندی و حرکت مبهم می‌گذارید، مدل فضای بیشتری برای حدس‌زدن پیدا می‌کند.

مدل ذهنی ساده: هر فایل یک نقشقبل از زدن Generate
Tمتن

ایده، رخداد، قاب، دوربین و صدا را توضیح می‌دهد.

تصویر

سوژه، محصول، رنگ، استایل یا فریم آغاز را مشخص می‌کند.

صدا

فضا، ریتم یا مرجع صوتی را هدایت می‌کند؛ گفتار دقیق را حتماً بررسی کنید.

ویدیو

حرکت، زمان‌بندی یا شات موجود برای ویرایش را به مدل می‌دهد.

هر ورودی «دلیل حضور» می‌خواهد. اگر دلیلش را در یک جمله نمی‌توانید بنویسید، آن فایل را وارد نکنید.
مهم‌ترین تصمیم مقاله

با چه ورودی‌ای شروع می‌کنید؟ چهار مسیر Gemini Omni در جنارا

کاتالوگ فعلی جنارا Gemini Omni Flash را در چهار حالت متن‌به‌ویدیو، عکس‌به‌ویدیو، مرجع‌به‌ویدیو و ویرایش ویدیو نشان می‌دهد. فرق این‌ها صرفاً اسم دکمه نیست؛ ورودی، انتظار و روش کنترل در هرکدام عوض می‌شود.

نقشهٔ انتخاب مسیردارایی فعلی → workflow → خروجی مورد انتظار
۱

فقط ایده یا متن دارم

Text-to-Video

وقتی قاب و سوژه آزادند و می‌خواهید مدل از توضیح شما شات بسازد. برای یک ایدهٔ تازه، یک رخداد اصلی و یک حرکت دوربین شروع خوبی است.

انتخاب کنید اگر: هنوز تصویر یا فیلم لازم برای حفظ ندارید.
۲

یک عکس مهم دارم

Image-to-Video

برای جان‌بخشیدن به محصول، پرتره، رندر یا تصویر ساخته‌شده. عکس شروع باید تمیز، با نور قابل‌فهم و فضای کافی برای حرکت باشد.

انتخاب کنید اگر: سوژه و ترکیب‌بندی باید از همان عکس آغاز شود.
۳

چند مرجع با نقش‌های متفاوت دارم

Reference-to-Video

وقتی یک فایل هویت محصول، فایل دیگر حرکت، فایل بعدی فضا یا صدا را مشخص می‌کند. نقش فایل‌ها را در prompt نام ببرید.

انتخاب کنید اگر: prompt تنها برای حفظ چند ویژگی کافی نیست.
۴

یک ویدیوی قبلی دارم

Video Edit

وقتی قاب، بازی یا زمان‌بندی قبلی ارزش حفظ‌کردن دارد و می‌خواهید فقط لباس، شیء، نور، افکت یا بخشی از روایت تغییر کند.

انتخاب کنید اگر: «نگه‌دار، فقط این را عوض کن» خواستهٔ اصلی شماست.

اگر بین دو مسیر مردد هستید، این سؤال تعیین‌کننده است: آیا باید پیکسل‌ها و حرکت ویدیوی قبلی حفظ شوند؟ اگر بله، از Edit شروع کنید. اگر ویدیوی تازه می‌خواهید اما چند ویژگی مرجع باید کنار هم بیایند، Reference-to-Video مناسب‌تر است. اگر فقط یک عکس نقطهٔ شروع شماست، Image-to-Video پیچیدگی اضافی ندارد.

قابلیت‌ها، با کاربرد واقعی

Gemini Omni Flash علاوه بر ساخت شات تازه چه کارهایی انجام می‌دهد؟

قابلیت‌ها وقتی مفیدند که تصمیم تولید را عوض کنند. جدول زیر هر توانایی را به یک ورودی، یک کاربرد و یک نقطهٔ کنترل وصل می‌کند؛ نه اینکه فقط فهرست ویژگی باشد.

کارت قابلیت‌های اصلیقابلیت مستندشده ≠ تضمین کیفیت هر خروجی
قابلیتچه چیزی می‌دهید؟چه زمانی مفید است؟نقطهٔ کنترل
Text-to-Videoتوضیح صحنه، حرکت، دوربین و صداوقتی ایده آزاد است و عکس اصلی نداریدفقط یک رخداد اصلی را در draft اول بسنجید
Image-to-Videoیک عکس + دستور حرکتمحصول، پرتره یا رندر باید قابل‌شناسایی بماندقبل از کیفیت نهایی، شکل، نوشته و حاشیهٔ سوژه را چک کنید
Reference-to-Videoترکیب متن و چند مرجع تصویر/صوت/ویدیوهویت، حرکت یا صدا از فایل‌های جدا می‌آیدنام و نقش هر مرجع را شفاف بنویسید
Video Editویدیوی موجود + دستور تغییربخش خوبی از شات را دارید و نمی‌خواهید از صفر بسازیدعبارت «چه چیزی ثابت بماند» را پیش از تغییر بنویسید
Interpolationفریم اول + فریم آخربرای انتقال کنترل‌شده از حالت A به Bدو فریم باید نور، لنز و دنیای بصری سازگار داشته باشند
Extendویدیوی کوتاه + ادامهٔ توصیفیوقتی شات خوب است اما چند ثانیه ادامه لازم داردتداوم سوژه، حرکت و صدا را بعد از اتصال بررسی کنید
درون‌یابی فریم ابتدا/انتها و extension در راهنمای رسمی Gemini Omni Flash توضیح داده شده‌اند. راهنمای رسمی تولید و ویرایش

فریم ابتدا و انتها؛ چه زمانی از Interpolation استفاده کنیم؟

درون‌یابی (Interpolation) یعنی به مدل دو تصویر بدهید: فریم آغاز و فریم پایان. خروجی باید مسیر رسیدن از اولی به دومی را بسازد. برای نمونه، بطری عطر روی میز در تصویر اول و همان بطری با پس‌زمینهٔ شب در تصویر دوم. این روش «دو عکس بی‌ربط را جادویی وصل می‌کند» نیست؛ هرقدر شکل محصول، زاویه دوربین و نور بین دو فریم نزدیک‌تر باشد، انتقال معقول‌تر می‌شود.

Extend؛ چه زمانی ادامه بهتر از ساخت دوباره است؟

اگر سه ثانیهٔ اول شات دقیقاً خوب شده، بازتولید از صفر ممکن است همان چهره، حرکت یا نور را از دست بدهد. ادامه‌دادن (Extend) برای ادامهٔ همان منطق شات مناسب است: مثلاً «دوربین push-in آرام را تا پایان جمله نگه دار». در مستندات Google، extension تا ۱۰ ثانیه در هر مرحله و تا طول کلی ۴۰ ثانیه شرح داده شده؛ اما در جنارا ابتدا تنظیمات و محدودیت همان workflow را چک کنید.

قابلیت اصلی که نباید پنهان بماند

Gemini Omni Flash چه چیزهایی را در ویدیوی موجود ادیت می‌کند؟

ادیت ویدیو (Video Edit) با ساخت دوباره فرق دارد: ویدیوی فعلی منبع اصلی است و شما تغییر مشخصی را با زبان طبیعی درخواست می‌کنید. در کاتالوگ فعلی جنارا، این حالت با مسیر مستقل Edit در گروه ویدیو‌به‌ویدیو ثبت شده است؛ یعنی اگر حرکت دوربین، بازی سوژه یا زمان‌بندی شات از قبل خوب است، لازم نیست همه‌چیز را از صفر تولید کنید.

چهار نوع ادیت کاربردیهر بار یک تغییر اصلی
افزودن عنصر یا افکت

مثلاً به ویدیوی اسکیت، رد نور متحرک اضافه کنید یا کلاهی روی سر سوژه بگذارید؛ در prompt بگویید بقیهٔ صحنه ثابت بماند.

حذف یا پنهان‌کردن

مثلاً تلفن داخل دست را نامرئی کنید. مدل باید فضای خالی را بازسازی کند؛ پس دست، سایه و پس‌زمینه را جداگانه کنترل کنید.

تغییر ظاهر و نور

ویدیو را به استایل انیمه ببرید یا نور را دراماتیک‌تر کنید، بدون اینکه حرکت و قاب اصلی را دوباره طراحی کنید.

اصلاح نوشته داخل شات

می‌توانید متن یک تابلو را عوض کنید؛ اما نوشتهٔ فارسی، لوگو و بسته‌بندی تجاری را در اندازهٔ واقعی بررسی و در صورت حساس‌بودن دستی نهایی کنید.

این نمونه‌ها در راهنمای رسمی Gemini Omni Flash آمده‌اند. قابلیت ادیت به معنی حفظ پیکسلی و بی‌نقص همهٔ جزئیات نیست.

برای ادیت کنترل‌شده، prompt را به «ثابت بماند / تغییر کند» تقسیم کنید

در ادیت، prompt بلند معمولاً کنترل را بیشتر نمی‌کند. اول دقیق بگویید چه چیزی باید دست‌نخورده بماند، سپس فقط یک تغییر را درخواست کنید. توصیهٔ رسمی گوگل برای تغییر جزئی، افزودن عبارت Keep everything else the same است.

فرمول کوتاه ادیتKeep → Change → Check
ثابت بماندحرکت دوربین، چهره، زمان‌بندی و شکل محصول
تغییر کندپس‌زمینه به میز مرمر تیره تبدیل شود و نور گرم‌تر شود
نمونه promptReplace the table background with dark marble and make the lighting warmer. Keep the bottle, label, camera movement, timing, and everything else the same. No extra objects.
بعد از خروجی، فقط زیبایی را نسنجید: لبه‌های سوژه، نوشته، دست‌ها، بازتاب، سایه و صدای کلیپ را با نسخهٔ قبل مقایسه کنید.

فرق Video Edit با Reference-to-Video چیست؟

در Video Edit، کلیپ شما بوم اصلی است و هدف حفظ ساختار آن همراه با یک تغییر محدود است. در Reference-to-Video، عکس یا ویدیو فقط مرجع هویت، حرکت یا استایل است و مدل یک شات تازه می‌سازد. اگر می‌گویید «همین کلیپ بماند، فقط نور عوض شود»، Edit مناسب‌تر است؛ اگر می‌گویید «حرکت این ویدیو را با محصول آن عکس در یک فضای تازه ترکیب کن»، Reference-to-Video را بررسی کنید.

ادیت را چطور مرحله‌به‌مرحله انجام دهیم؟

کلیپ پایه را انتخاب کنید

کلیپی بدهید که حرکت، قاب یا بازی آن ارزش حفظ‌کردن دارد. ورودی آپلودشده برای ادیت طبق راهنمای فعلی گوگل باید ۱۰ ثانیه یا کمتر باشد؛ محدودیت نمایش‌داده‌شده در خود جنارا را نیز پیش از اجرا چک کنید.

Checkpoint: اگر بیش از نیمی از شات باید عوض شود، ساخت شات تازه را هم مقایسه کنید.

یک تغییر را تعریف کنید

افزودن شیء، حذف مزاحم، تغییر نور، تغییر استایل یا اصلاح نوشته را در یک مرحله انجام دهید؛ چند تغییر مستقل را روی هم نریزید.

Checkpoint: درخواست را بتوانید در یک جمله بدون «و همچنین» بنویسید.

قفل‌ها را صریح بنویسید

سوژه، حرکت دوربین، زمان‌بندی، محصول، نوشته و صدا هرکدام که باید حفظ شوند نام ببرید.

Checkpoint: Keep everything else the same را جایگزین تعریف دقیق دارایی حساس نکنید.

قبل و بعد را فریم‌به‌فریم کنترل کنید

تغییر ناخواسته در دست، چهره، لوگو، بازتاب، تماس اجسام و صدا را پیدا کنید؛ سپس فقط همان خطا را در مرحلهٔ بعد اصلاح کنید.

Checkpoint: ادیت پذیرفته‌شده باید هم تغییر خواسته‌شده را انجام دهد و هم دارایی‌های قفل‌شده را حفظ کند.
کنترل مهم‌تر از تعداد فایل

برای Gemini Omni چه بنویسیم تا حرکت و صدا قابل کنترل‌تر شود؟

پرامپت لازم نیست پر از اصطلاح سینمایی باشد. باید سه ابهام را کم کند: چه چیزی ثابت می‌ماند؟ چه چیزی حرکت می‌کند؟ چه چیزی نباید دیده یا شنیده شود؟ در Image-to-Video، کیفیت عکس و توصیف مشخص حرکت از «make it move» مفیدتر است؛ این توصیه مستقیماً در راهنمای رسمی مدل آمده است.

قالب پیشنهادی برای یک شات محصول[ROLE] Use Image 1 as the exact product identity and starting composition. [MOTION] One slow camera push-in; the bottle remains upright and unchanged. [SCENE] Warm violet reflections on a dark stone table, no new objects. [AUDIO] Soft room ambience, no dialogue, no music vocals. [GUARDRAIL] Keep the Persian label on the bottle unchanged and readable.
سناریوی تمرینی

سناریوی پیشنهادی: یک ریلز ۸ ثانیه‌ای برای معرفی عطر بسازیم

فرض کنید برند «مهرا» یک عکس تمیز از محصول دارد، اما فیلم‌برداری ندارد. هدف، یک ریلز عمودی ۸ ثانیه‌ای است که محصول را در فضای شبانه نشان دهد؛ نه ادعای پزشکی دارد و نه گفتار ضروری. این پروژه پیشنهادی است؛ بنابراین نباید آن را تست اجراشدهٔ جنارا بدانید.

دارایی‌ها و تصمیم

چون شات تازه است و چند مرجع نقش جداگانه دارند، Reference-to-Video نقطهٔ شروع است. اگر فقط عکس محصول داریم، Image-to-Video کم‌پیچیدگی‌تر است.

تصویر تمیز محصول، بدون لوگوی اضافه یا دستِ بریده
ویدیوی مرجع ۵ ثانیه‌ای برای ریتم push-in
عکس فضای نورپردازی، فقط برای mood
خروجی عمودی ۹:۱۶، ۸ ثانیه، بدون دیالوگ
checkpoint این کیس: آیا شکل بطری ثابت ماند؟ آیا نور فقط mood را منتقل کرد؟ آیا حرکت دوربین با ویدیوی مرجع هم‌خوان است؟

یک draft کم‌ریسک بسازید

ابتدا با عکس محصول و یک حرکت آرام شروع کنید. این آزمایش باید فقط هویت و حرکت را بسنجد، نه صدای پیچیده یا چند رخداد.

چک کنید: شکل، ارتفاع، رنگ و نوشتهٔ محصول تغییر نکرده باشد.

یک مرجع اضافه کنید، نه همه را

اگر حرکت خوب نیست، فقط ویدیوی مرجع حرکت را اضافه و نقش آن را صریح بنویسید. محصول از عکس می‌آید؛ حرکت از ویدیو.

چک کنید: محصول ناگهان با محتوای ویدیوی مرجع جایگزین نشده باشد.

بعد از تأیید، صدا یا نور را وارد کنید

پس از اینکه حرکت و هویت قابل قبول شد، فضای صوتی یا عکس mood را اضافه کنید. هر بار فقط یک متغیر را عوض کنید تا علت خطا را پیدا کنید.

چک کنید: اضافه‌شدن صدا یا mood، سوژهٔ اصلی را خراب نکرده باشد.
مقایسه بدون جانبداری

Gemini Omni Flash در برابر Kling، Seedance و Veo؛ کدام‌یک را انتخاب کنیم؟

این بخش «برندهٔ مطلق» معرفی نمی‌کند، چون آزمون کنترل‌شده با ورودی و تنظیمات یکسان برای همه مدل‌ها انجام نشده است. انتخاب را با نوع دارایی، کنترل موردنیاز و خروجی مقصد انجام دهید.

ماتریس تصمیم مبتنی بر منابعاگر شرط عوض شد، پیشنهاد هم عوض می‌شود
اگر مسئلهٔ شما این است…اول بررسی کنیدچرااما اگر…
ترکیب تصویر، ویدیو، صدا و دستور در یک شات تازهGemini Omni Flash · Reference-to-Videoبرای ورودی چندرسانه‌ای و نقش‌دهی منابع طراحی شده است.حرکت بدن باید دقیقاً کپی شود → Motion Control را بررسی کنید.
یک عکس محصول با حرکت کوتاه و آزادGemini Omni یا Kling · Image-to-Videoهر دو می‌توانند از عکس شروع کنند؛ با همان عکس خودتان draft بگیرید.فریم آغاز و پایان دقیق دارید → workflow Start/End یا Interpolation مهم‌تر می‌شود.
ویدیوی موجود را تغییر می‌دهمGemini Omni Flash · Video Editحفظ شات و درخواست تغییر طبیعی، مسئلهٔ اصلی است.تنها هدف ادامهٔ طولانی‌تر و وضوح بالا است → Veo/Extend و محدودیت همان endpoint را مقایسه کنید.
مجری با گفتار کنترل‌شدهٔ فارسیAvatar یا LipSync تخصصیمشکل اصلی هماهنگی گفتار و چهره است، نه ساخت یک شات چندمرجعی.محیط و حرکت جدید همراه با گفتار می‌خواهید → Reference-to-Video را به‌عنوان شات تازه بررسی کنید.
چند تصویر مرجع و کنترل ترکیب آن‌هاGemini Omni یا Seedanceهر دو گروه چندمرجعی‌اند؛ ظرفیت فایل، قیمت و کیفیت همان ورودی را مقایسه کنید.یک حرکت مرجع دقیق دارید → Motion Control شرطی‌تر و مناسب‌تر است.
دسترسی در جنارا یک واقعیت تحویل است، نه اثبات کیفیت برتر. قبل از خروجی نهایی، یک brief و یک ورودی یکسان را در مسیرهای نزدیک مقایسه کنید.
از generation خراب چه یاد بگیریم؟

۴ خطای رایج در Gemini Omni و راه اصلاح آن‌ها

نشانهمحصول یا چهره عوض می‌شود
علت محتملیک مرجع چند نقش مبهم دارد یا عکس اولیه ضعیف است
اصلاح بعدیمرجع تمیزتر انتخاب کنید و صریح بنویسید «هویت و شکل محصول از Image 1 ثابت بماند».
نشانهحرکت عجیب یا بیش‌ازحد شلوغ است
علت محتملهم‌زمان چند حرکت، تغییر صحنه و افکت خواسته‌اید
اصلاح بعدییک حرکت اصلی و یک حرکت دوربین بنویسید؛ رخداد دوم را به نسخه بعد منتقل کنید.
نشانهصدا با تصویر یا هدف هم‌خوان نیست
علت محتملبرای صدا هیچ نقش یا توصیف نداده‌اید
اصلاح بعدینوع ambience، موسیقی یا نبود دیالوگ را روشن بنویسید و خروجی صوتی را جدا بررسی کنید.
نشانهویرایش، چیزهای سالم را هم تغییر می‌دهد
علت محتملفقط «چه چیزی عوض شود» گفته‌اید
اصلاح بعدیدو بخش prompt بنویسید: «حفظ کن» و «فقط تغییر بده»؛ تغییر را کوچک و مرحله‌ای نگه دارید.

خلاصهٔ تصمیم‌های اصلی

ساخت تازهمتن یا عکس برای یک شات جدید
چند مرجعهر فایل یک نقش روشن: هویت، حرکت، صدا یا فضا
Editیک تغییر مشخص و فهرست چیزهایی که باید ثابت بمانند
Extendادامه همان ویدیو؛ نه ساخت مستقل با حال‌وهوای مشابه

سؤال‌هایی که قبل از ساخت ویدیوی Omni پیش می‌آید

Gemini Omni Flash برای تولید ویدیو از متن بهتر است یا عکس؟

هیچ‌کدام به‌طور مطلق بهتر نیست. اگر ظاهر و ترکیب‌بندی از قبل مهم است، عکس بهتر از توضیح متنی آن‌ها را قفل می‌کند. اگر ایده هنوز آزاد است، Text-to-Video انعطاف بیشتری می‌دهد.

Reference-to-Video همان Image-to-Video است؟

خیر. Image-to-Video معمولاً یک تصویر شروع را متحرک می‌کند؛ Reference-to-Video برای ترکیب نقش‌های جدا مانند سوژه، حرکت، فضا و صداست. فقط وقتی مرجع دوم واقعاً تصمیم شما را تغییر می‌دهد، آن را اضافه کنید.

برای حرف‌زدن یک پرتره، Gemini Omni انتخاب اول است؟

اگر کیفیت و کنترل گفتار، لب و چهره مسئلهٔ اصلی است، ابتدا workflow آواتار یا لب‌سینک را بررسی کنید. Omni زمانی منطقی است که هم‌زمان می‌خواهید یک شات یا محیط تازه را با چند مرجع بسازید.

چطور ویدیوی ۸ ثانیه‌ای را بلندتر کنم؟

اگر تداوم همان شات مهم است، قابلیت Extend را بررسی کنید و ادامهٔ حرکت و صدا را دقیق بنویسید. اگر می‌خواهید روایت چند شات داشته باشید، شات‌ها را جدا بسازید و در تدوین به هم وصل کنید؛ این روش کنترل بیشتری می‌دهد.

آیا متن فارسی روی محصول یا تابلو بی‌نقص ساخته می‌شود؟

نباید آن را تضمین کنید. متن تولیدشده را در اندازهٔ واقعی و زوم کنترل کنید. برای دارایی تجاری حساس، نسخهٔ نهایی متن را در ابزار طراحی یا تدوین اضافه کنید.