ویدیوی اصلی
چهره، نور، حرکت دوربین و اجرای بدن
کلیپ چهره و صدای جدید را وارد کنید؛ Kling LipSync همان تصویر و بازی را نگه میدارد و حرکت لب را با گفتار تازه هماهنگ میکند.
ورود متن فارسی یک قابلیت ترکیبی جنارا است: جنارا ابتدا متن را به صدا تبدیل میکند و سپس مسیر صوتی Kling اجرا میشود. فقط عکس دارید؟ Kling AI Avatar را انتخاب کنید.
این مدل ابزار تدوین کامل نیست. تصویر، قاب و بازی اصلی از ویدیوی شما میآیند؛ صدای جدید فقط حرکت لب را دوباره هدایت میکند.
چهره، نور، حرکت دوربین و اجرای بدن
حرکت لب متناسب با گفتار جدید بازسازی میشود
محدودیتهای زیر مربوط به مسیرهای مرجع fal هستند؛ پشتیبانی فعال و اعتبار نهایی در استودیوی جنارا نمایش داده میشود.
MP4 یا MOV · حداکثر ۱۰۰ مگابایت
عرض و ارتفاع بین ۷۲۰ تا ۱۹۲۰ پیکسل
MP3، WAV، M4A، AAC یا OGG · حداکثر ۵ مگابایت
دیالوگ عوض میشود؛ قاب و بازی اصلی حفظ میشوند
روی هر مسیر بزنید تا ورودی و خروجی دقیق آن را ببینید.
بهترین مسیر برای دوبله فارسی، بازنویسی دیالوگ و اصلاح صدای کلیپ است.
برای فارسی، مسیر فایل صوتی یا تبدیل متن به گفتار در جنارا انتخاب شفافتری است.اگر یک ویدیوی آماده و صدای تازه دارید، Kling LipSync حرکت لب شخصیت را با دیالوگ یا آواز جدید هماهنگ میکند. پایینتر میتوانید تفاوت آن را با Sync و VEED ببینید.
برای دوبله و تغییر دیالوگ یک ویدیوی کوتاه با فایل صوتی یا متن.
مسیر فعلی: فایل صوتی
۲ تا ۱۰ ثانیه، دهان واضح و بدون برش سریع
یک گوینده با صدای تمیز و مکث طبیعی
سکوت اضافه را ببرید و طول جمله را به کلیپ نزدیک کنید
حرکت لب، تلفظ و پایان کلیپ را بازبینی کنید
دیالوگ یک ویدیوی خارجی را با صدای فارسی جایگزین کنید.
کلیپ چهره + صدای دوبلهبدون فیلمبرداری دوباره، جمله اشتباه یا قدیمی را عوض کنید.
همان کلیپ + صدای اصلاحشدهاز یک اجرای تصویری، نسخههای صوتی برای بازارهای مختلف بسازید.
یک ویدیو + چند فایل صوتیپیام یا پیشنهاد کمپین را روی کلیپ موجود بهروزرسانی کنید.
ویدیوی تبلیغ + متن تازهنریشن مدرس یا راهنمای محصول را بدون ضبط دوباره تصویر اصلاح کنید.
ویدیوی مدرس + صدای جدیدبرای کاراکتر یا چهره مجاز، دیالوگ تازه و هماهنگ بسازید.
کلیپ واضح + دیالوگ کوتاهفایل موجود و چیزی که میخواهید تغییر کند، مسیر مناسب را مشخص میکند.
علت محتمل: شروع فایل صوتی سکوت دارد یا ریتم گفتار با کلیپ خیلی متفاوت است
راهحل: سکوت ابتدا و انتهای صدا را کوتاه کنید و طول دیالوگ را به اجرای اصلی نزدیک نگه دارید.
علت محتمل: صورت کوچک، زاویه زیاد یا دهان پوشیده است
راهحل: کلیپی با چهره بزرگتر، نور یکنواخت و دهان کاملا قابلدیدن انتخاب کنید.
علت محتمل: نویز، موسیقی بلند یا همپوشانی چند گوینده
راهحل: صدای یک گوینده را جدا کنید، نویز را کم کنید و حجم گفتار را یکنواخت نگه دارید.
علت محتمل: مدت دیالوگ با فضای زمانی کلیپ تناسب ندارد
راهحل: پیش از ساخت، صدا را کوتاه یا کلیپ را در تدوین هماندازه کنید و نتیجه را بازبینی کنید.
هنوز نمونهای برای گالری Kling LipSync منتشر نشده است.
ابزاری برای هماهنگکردن حرکت لب در یک ویدیوی موجود با فایل صوتی یا گفتار تازه است. برخلاف آواتار، صحنه را از یک عکس نمیسازد؛ همان کلیپ را نگه میدارد و دیالوگ آن را تغییر میدهد.
در مسیر صوتی، یک ویدیوی چهره و یک فایل صوتی لازم است. ویدیو باید MP4 یا MOV، بین ۲ تا ۱۰ ثانیه، حداکثر ۱۰۰ مگابایت و با کیفیت 720p یا 1080p باشد. فایل صوتی میتواند ۲ تا ۶۰ ثانیه و حداکثر ۵ مگابایت باشد.
بله، در مسیر فایل صوتی میتوانید گفتار فارسی وارد کنید. کیفیت ضبط، واضحبودن تلفظ و نبود موسیقی بلند از زبان پرامپت مهمتر است. زبان صدا با زبان توضیح یا پرامپت دو موضوع جدا هستند.
در جنارا بله. متن فارسی ابتدا با صدای انتخابی شما به فایل صوتی تبدیل میشود و سپس آن صدا وارد مسیر LipSync میشود. مسیر مستقیم متن در ارائهدهنده مرجع فقط انگلیسی و چینی را فهرست میکند، بنابراین برای فارسی مسیر تبدیل متن به صدا شفافتر است.
اگر صدای نهایی را دارید، فایل صوتی کنترل مستقیمتری روی لحن، مکث و تلفظ میدهد. اگر فقط متن دارید، جنارا آن را به گفتار تبدیل میکند و بعد همان فرایند هماهنگی لب اجرا میشود.
مشخصات ورودی اجازه میدهد طول صدا و ویدیو یکسان نباشد، اما برای نتیجه طبیعی بهتر است دیالوگ را با فضای زمانی کلیپ هماهنگ کنید. سکوت اضافه را ببرید، جمله را کوتاه کنید و پایان خروجی را پیش از انتشار بازبینی کنید.
چهره و دهان باید واضح، نسبتا بزرگ و بدون پوشیدگی باشند. نور یکنواخت، حرکت دوربین کم، زاویه روبهرو یا سهرخ ملایم و نبود برش سریع معمولا نتیجه پایدارتری میدهد.
LipSync برای کلیپ آماده است و فقط دیالوگ و حرکت لب را هماهنگ میکند. AI Avatar از یک تصویر ثابت و صدا، ویدیوی سخنگوی تازه میسازد. اگر ویدیو دارید LipSync؛ اگر فقط عکس دارید Avatar را انتخاب کنید.
اعتبار نهایی پیش از ساخت در استودیو نمایش داده میشود. قیمت مرجع fal در زمان بازبینی ۰٫۰۱۴ دلار برای هر ثانیه ویدیوی ورودی است و مدت برای محاسبه به نزدیکترین بازه ۵ ثانیه رو به بالا گرد میشود؛ این عدد معادل اعتبار جنارا نیست.
شرایط استفاده به حساب جنارا، ارائهدهنده فعال و حقوق محتوای ورودی بستگی دارد. برای چهره و صدای اشخاص، موسیقی، لوگو و محتوای دارای حق نشر باید مجوز و رضایت لازم را داشته باشید؛ از LipSync برای جعل هویت یا نسبتدادن سخن به افراد بدون رضایت استفاده نکنید.