پاسخ کوتاه: Gemini Omni Flash یک مدل ویدیویی چندوجهی (Multimodal) است: میتواند متن، تصویر، صدا و ویدیو را بفهمد و یک ویدیوی کوتاه با صدای همگام بسازد یا ویدیوی موجود را با دستور طبیعی تغییر دهد. در جنارا، قبل از انتخاب مدل، مشخص کنید میخواهید «شات تازه» بسازید یا «شات موجود» را اصلاح کنید؛ سپس دارایی اصلیتان را انتخاب کنید.
Gemini Omni Flash چتبات Gemini نیست؛ یک مسیر برای ویدیوی چندمرجعی است
نام Gemini ممکن است یادآور گفتوگو یا تحلیل متن باشد؛ اما Gemini Omni Flash برای خروجی ویدیویی طراحی شده است. «چندوجهی» اینجا یعنی میتوانید همزمان یک دستور، تصویر محصول، ویدیوی مرجع حرکت و صدای محیط داشته باشید؛ مدل باید از آنها یک شات منسجم بسازد.
این به معنی آن نیست که هر فایل را بیدلیل وارد کنید. هر مرجع باید فقط یک نقش اصلی داشته باشد: ظاهر محصول، سوژه، حرکت، فضا یا صدا. وقتی یک عکس را همزمان برای هویت، ترکیببندی و حرکت مبهم میگذارید، مدل فضای بیشتری برای حدسزدن پیدا میکند.
ایده، رخداد، قاب، دوربین و صدا را توضیح میدهد.
سوژه، محصول، رنگ، استایل یا فریم آغاز را مشخص میکند.
فضا، ریتم یا مرجع صوتی را هدایت میکند؛ گفتار دقیق را حتماً بررسی کنید.
حرکت، زمانبندی یا شات موجود برای ویرایش را به مدل میدهد.
با چه ورودیای شروع میکنید؟ چهار مسیر Gemini Omni در جنارا
کاتالوگ فعلی جنارا Gemini Omni Flash را در چهار حالت متنبهویدیو، عکسبهویدیو، مرجعبهویدیو و ویرایش ویدیو نشان میدهد. فرق اینها صرفاً اسم دکمه نیست؛ ورودی، انتظار و روش کنترل در هرکدام عوض میشود.
فقط ایده یا متن دارم
Text-to-Video
وقتی قاب و سوژه آزادند و میخواهید مدل از توضیح شما شات بسازد. برای یک ایدهٔ تازه، یک رخداد اصلی و یک حرکت دوربین شروع خوبی است.
انتخاب کنید اگر: هنوز تصویر یا فیلم لازم برای حفظ ندارید.یک عکس مهم دارم
Image-to-Video
برای جانبخشیدن به محصول، پرتره، رندر یا تصویر ساختهشده. عکس شروع باید تمیز، با نور قابلفهم و فضای کافی برای حرکت باشد.
انتخاب کنید اگر: سوژه و ترکیببندی باید از همان عکس آغاز شود.چند مرجع با نقشهای متفاوت دارم
Reference-to-Video
وقتی یک فایل هویت محصول، فایل دیگر حرکت، فایل بعدی فضا یا صدا را مشخص میکند. نقش فایلها را در prompt نام ببرید.
انتخاب کنید اگر: prompt تنها برای حفظ چند ویژگی کافی نیست.یک ویدیوی قبلی دارم
Video Edit
وقتی قاب، بازی یا زمانبندی قبلی ارزش حفظکردن دارد و میخواهید فقط لباس، شیء، نور، افکت یا بخشی از روایت تغییر کند.
انتخاب کنید اگر: «نگهدار، فقط این را عوض کن» خواستهٔ اصلی شماست.اگر بین دو مسیر مردد هستید، این سؤال تعیینکننده است: آیا باید پیکسلها و حرکت ویدیوی قبلی حفظ شوند؟ اگر بله، از Edit شروع کنید. اگر ویدیوی تازه میخواهید اما چند ویژگی مرجع باید کنار هم بیایند، Reference-to-Video مناسبتر است. اگر فقط یک عکس نقطهٔ شروع شماست، Image-to-Video پیچیدگی اضافی ندارد.
Gemini Omni Flash علاوه بر ساخت شات تازه چه کارهایی انجام میدهد؟
قابلیتها وقتی مفیدند که تصمیم تولید را عوض کنند. جدول زیر هر توانایی را به یک ورودی، یک کاربرد و یک نقطهٔ کنترل وصل میکند؛ نه اینکه فقط فهرست ویژگی باشد.
| قابلیت | چه چیزی میدهید؟ | چه زمانی مفید است؟ | نقطهٔ کنترل |
|---|---|---|---|
| Text-to-Video | توضیح صحنه، حرکت، دوربین و صدا | وقتی ایده آزاد است و عکس اصلی ندارید | فقط یک رخداد اصلی را در draft اول بسنجید |
| Image-to-Video | یک عکس + دستور حرکت | محصول، پرتره یا رندر باید قابلشناسایی بماند | قبل از کیفیت نهایی، شکل، نوشته و حاشیهٔ سوژه را چک کنید |
| Reference-to-Video | ترکیب متن و چند مرجع تصویر/صوت/ویدیو | هویت، حرکت یا صدا از فایلهای جدا میآید | نام و نقش هر مرجع را شفاف بنویسید |
| Video Edit | ویدیوی موجود + دستور تغییر | بخش خوبی از شات را دارید و نمیخواهید از صفر بسازید | عبارت «چه چیزی ثابت بماند» را پیش از تغییر بنویسید |
| Interpolation | فریم اول + فریم آخر | برای انتقال کنترلشده از حالت A به B | دو فریم باید نور، لنز و دنیای بصری سازگار داشته باشند |
| Extend | ویدیوی کوتاه + ادامهٔ توصیفی | وقتی شات خوب است اما چند ثانیه ادامه لازم دارد | تداوم سوژه، حرکت و صدا را بعد از اتصال بررسی کنید |
فریم ابتدا و انتها؛ چه زمانی از Interpolation استفاده کنیم؟
درونیابی (Interpolation) یعنی به مدل دو تصویر بدهید: فریم آغاز و فریم پایان. خروجی باید مسیر رسیدن از اولی به دومی را بسازد. برای نمونه، بطری عطر روی میز در تصویر اول و همان بطری با پسزمینهٔ شب در تصویر دوم. این روش «دو عکس بیربط را جادویی وصل میکند» نیست؛ هرقدر شکل محصول، زاویه دوربین و نور بین دو فریم نزدیکتر باشد، انتقال معقولتر میشود.
Extend؛ چه زمانی ادامه بهتر از ساخت دوباره است؟
اگر سه ثانیهٔ اول شات دقیقاً خوب شده، بازتولید از صفر ممکن است همان چهره، حرکت یا نور را از دست بدهد. ادامهدادن (Extend) برای ادامهٔ همان منطق شات مناسب است: مثلاً «دوربین push-in آرام را تا پایان جمله نگه دار». در مستندات Google، extension تا ۱۰ ثانیه در هر مرحله و تا طول کلی ۴۰ ثانیه شرح داده شده؛ اما در جنارا ابتدا تنظیمات و محدودیت همان workflow را چک کنید.
Gemini Omni Flash چه چیزهایی را در ویدیوی موجود ادیت میکند؟
ادیت ویدیو (Video Edit) با ساخت دوباره فرق دارد: ویدیوی فعلی منبع اصلی است و شما تغییر مشخصی را با زبان طبیعی درخواست میکنید. در کاتالوگ فعلی جنارا، این حالت با مسیر مستقل Edit در گروه ویدیوبهویدیو ثبت شده است؛ یعنی اگر حرکت دوربین، بازی سوژه یا زمانبندی شات از قبل خوب است، لازم نیست همهچیز را از صفر تولید کنید.
مثلاً به ویدیوی اسکیت، رد نور متحرک اضافه کنید یا کلاهی روی سر سوژه بگذارید؛ در prompt بگویید بقیهٔ صحنه ثابت بماند.
مثلاً تلفن داخل دست را نامرئی کنید. مدل باید فضای خالی را بازسازی کند؛ پس دست، سایه و پسزمینه را جداگانه کنترل کنید.
ویدیو را به استایل انیمه ببرید یا نور را دراماتیکتر کنید، بدون اینکه حرکت و قاب اصلی را دوباره طراحی کنید.
میتوانید متن یک تابلو را عوض کنید؛ اما نوشتهٔ فارسی، لوگو و بستهبندی تجاری را در اندازهٔ واقعی بررسی و در صورت حساسبودن دستی نهایی کنید.
برای ادیت کنترلشده، prompt را به «ثابت بماند / تغییر کند» تقسیم کنید
در ادیت، prompt بلند معمولاً کنترل را بیشتر نمیکند. اول دقیق بگویید چه چیزی باید دستنخورده بماند، سپس فقط یک تغییر را درخواست کنید. توصیهٔ رسمی گوگل برای تغییر جزئی، افزودن عبارت Keep everything else the same است.
Replace the table background with dark marble and make the lighting warmer. Keep the bottle, label, camera movement, timing, and everything else the same. No extra objects.فرق Video Edit با Reference-to-Video چیست؟
در Video Edit، کلیپ شما بوم اصلی است و هدف حفظ ساختار آن همراه با یک تغییر محدود است. در Reference-to-Video، عکس یا ویدیو فقط مرجع هویت، حرکت یا استایل است و مدل یک شات تازه میسازد. اگر میگویید «همین کلیپ بماند، فقط نور عوض شود»، Edit مناسبتر است؛ اگر میگویید «حرکت این ویدیو را با محصول آن عکس در یک فضای تازه ترکیب کن»، Reference-to-Video را بررسی کنید.
ادیت را چطور مرحلهبهمرحله انجام دهیم؟
کلیپ پایه را انتخاب کنید
کلیپی بدهید که حرکت، قاب یا بازی آن ارزش حفظکردن دارد. ورودی آپلودشده برای ادیت طبق راهنمای فعلی گوگل باید ۱۰ ثانیه یا کمتر باشد؛ محدودیت نمایشدادهشده در خود جنارا را نیز پیش از اجرا چک کنید.
یک تغییر را تعریف کنید
افزودن شیء، حذف مزاحم، تغییر نور، تغییر استایل یا اصلاح نوشته را در یک مرحله انجام دهید؛ چند تغییر مستقل را روی هم نریزید.
قفلها را صریح بنویسید
سوژه، حرکت دوربین، زمانبندی، محصول، نوشته و صدا هرکدام که باید حفظ شوند نام ببرید.
قبل و بعد را فریمبهفریم کنترل کنید
تغییر ناخواسته در دست، چهره، لوگو، بازتاب، تماس اجسام و صدا را پیدا کنید؛ سپس فقط همان خطا را در مرحلهٔ بعد اصلاح کنید.
برای Gemini Omni چه بنویسیم تا حرکت و صدا قابل کنترلتر شود؟
پرامپت لازم نیست پر از اصطلاح سینمایی باشد. باید سه ابهام را کم کند: چه چیزی ثابت میماند؟ چه چیزی حرکت میکند؟ چه چیزی نباید دیده یا شنیده شود؟ در Image-to-Video، کیفیت عکس و توصیف مشخص حرکت از «make it move» مفیدتر است؛ این توصیه مستقیماً در راهنمای رسمی مدل آمده است.
[ROLE] Use Image 1 as the exact product identity and starting composition.
[MOTION] One slow camera push-in; the bottle remains upright and unchanged.
[SCENE] Warm violet reflections on a dark stone table, no new objects.
[AUDIO] Soft room ambience, no dialogue, no music vocals.
[GUARDRAIL] Keep the Persian label on the bottle unchanged and readable.سناریوی پیشنهادی: یک ریلز ۸ ثانیهای برای معرفی عطر بسازیم
فرض کنید برند «مهرا» یک عکس تمیز از محصول دارد، اما فیلمبرداری ندارد. هدف، یک ریلز عمودی ۸ ثانیهای است که محصول را در فضای شبانه نشان دهد؛ نه ادعای پزشکی دارد و نه گفتار ضروری. این پروژه پیشنهادی است؛ بنابراین نباید آن را تست اجراشدهٔ جنارا بدانید.
داراییها و تصمیم
چون شات تازه است و چند مرجع نقش جداگانه دارند، Reference-to-Video نقطهٔ شروع است. اگر فقط عکس محصول داریم، Image-to-Video کمپیچیدگیتر است.
یک draft کمریسک بسازید
ابتدا با عکس محصول و یک حرکت آرام شروع کنید. این آزمایش باید فقط هویت و حرکت را بسنجد، نه صدای پیچیده یا چند رخداد.
یک مرجع اضافه کنید، نه همه را
اگر حرکت خوب نیست، فقط ویدیوی مرجع حرکت را اضافه و نقش آن را صریح بنویسید. محصول از عکس میآید؛ حرکت از ویدیو.
بعد از تأیید، صدا یا نور را وارد کنید
پس از اینکه حرکت و هویت قابل قبول شد، فضای صوتی یا عکس mood را اضافه کنید. هر بار فقط یک متغیر را عوض کنید تا علت خطا را پیدا کنید.
Gemini Omni Flash در برابر Kling، Seedance و Veo؛ کدامیک را انتخاب کنیم؟
این بخش «برندهٔ مطلق» معرفی نمیکند، چون آزمون کنترلشده با ورودی و تنظیمات یکسان برای همه مدلها انجام نشده است. انتخاب را با نوع دارایی، کنترل موردنیاز و خروجی مقصد انجام دهید.
| اگر مسئلهٔ شما این است… | اول بررسی کنید | چرا | اما اگر… |
|---|---|---|---|
| ترکیب تصویر، ویدیو، صدا و دستور در یک شات تازه | Gemini Omni Flash · Reference-to-Video | برای ورودی چندرسانهای و نقشدهی منابع طراحی شده است. | حرکت بدن باید دقیقاً کپی شود → Motion Control را بررسی کنید. |
| یک عکس محصول با حرکت کوتاه و آزاد | Gemini Omni یا Kling · Image-to-Video | هر دو میتوانند از عکس شروع کنند؛ با همان عکس خودتان draft بگیرید. | فریم آغاز و پایان دقیق دارید → workflow Start/End یا Interpolation مهمتر میشود. |
| ویدیوی موجود را تغییر میدهم | Gemini Omni Flash · Video Edit | حفظ شات و درخواست تغییر طبیعی، مسئلهٔ اصلی است. | تنها هدف ادامهٔ طولانیتر و وضوح بالا است → Veo/Extend و محدودیت همان endpoint را مقایسه کنید. |
| مجری با گفتار کنترلشدهٔ فارسی | Avatar یا LipSync تخصصی | مشکل اصلی هماهنگی گفتار و چهره است، نه ساخت یک شات چندمرجعی. | محیط و حرکت جدید همراه با گفتار میخواهید → Reference-to-Video را بهعنوان شات تازه بررسی کنید. |
| چند تصویر مرجع و کنترل ترکیب آنها | Gemini Omni یا Seedance | هر دو گروه چندمرجعیاند؛ ظرفیت فایل، قیمت و کیفیت همان ورودی را مقایسه کنید. | یک حرکت مرجع دقیق دارید → Motion Control شرطیتر و مناسبتر است. |
۴ خطای رایج در Gemini Omni و راه اصلاح آنها
خلاصهٔ تصمیمهای اصلی
سؤالهایی که قبل از ساخت ویدیوی Omni پیش میآید
Gemini Omni Flash برای تولید ویدیو از متن بهتر است یا عکس؟
هیچکدام بهطور مطلق بهتر نیست. اگر ظاهر و ترکیببندی از قبل مهم است، عکس بهتر از توضیح متنی آنها را قفل میکند. اگر ایده هنوز آزاد است، Text-to-Video انعطاف بیشتری میدهد.
Reference-to-Video همان Image-to-Video است؟
خیر. Image-to-Video معمولاً یک تصویر شروع را متحرک میکند؛ Reference-to-Video برای ترکیب نقشهای جدا مانند سوژه، حرکت، فضا و صداست. فقط وقتی مرجع دوم واقعاً تصمیم شما را تغییر میدهد، آن را اضافه کنید.
برای حرفزدن یک پرتره، Gemini Omni انتخاب اول است؟
اگر کیفیت و کنترل گفتار، لب و چهره مسئلهٔ اصلی است، ابتدا workflow آواتار یا لبسینک را بررسی کنید. Omni زمانی منطقی است که همزمان میخواهید یک شات یا محیط تازه را با چند مرجع بسازید.
چطور ویدیوی ۸ ثانیهای را بلندتر کنم؟
اگر تداوم همان شات مهم است، قابلیت Extend را بررسی کنید و ادامهٔ حرکت و صدا را دقیق بنویسید. اگر میخواهید روایت چند شات داشته باشید، شاتها را جدا بسازید و در تدوین به هم وصل کنید؛ این روش کنترل بیشتری میدهد.
آیا متن فارسی روی محصول یا تابلو بینقص ساخته میشود؟
نباید آن را تضمین کنید. متن تولیدشده را در اندازهٔ واقعی و زوم کنترل کنید. برای دارایی تجاری حساس، نسخهٔ نهایی متن را در ابزار طراحی یا تدوین اضافه کنید.



