ویدیوی آماده، صدای تازه، لب هماهنگ

لیپ‌سینک ویدیو با Kling LipSync

کلیپ چهره و صدای جدید را وارد کنید؛ Kling LipSync همان تصویر و بازی را نگه می‌دارد و حرکت لب را با گفتار تازه هماهنگ می‌کند.

ورود متن فارسی یک قابلیت ترکیبی جنارا است: جنارا ابتدا متن را به صدا تبدیل می‌کند و سپس مسیر صوتی Kling اجرا می‌شود. فقط عکس دارید؟ Kling AI Avatar را انتخاب کنید.

ورودی‌های واقعی مدل
Kling LipSync
ویدیوی چهرهلازم
فایل گفتارلازم
پرامپت
برای این مسیر پرامپت لازم نیست؛ کیفیت ویدیوی چهره و صدای گفتار نتیجه را تعیین می‌کند.
تنظیمات کلیدی
ویدیوی ۲ تا ۱۰ ثانیه720p یا 1080pیک گویندهدهان واضح
شروع با ویدیو و فایل صوتی
۱ ویدیوچهره و اجرای موجود
۱ صدا یا متندیالوگ و زمان‌بندی تازه
۲ تا ۱۰ ثانیهمدت ویدیوی ورودی
720p یا 1080pکیفیت ویدیوی ورودی
تعریف ساده

Kling LipSync دقیقا چه چیزی را تغییر می‌دهد؟

این مدل ابزار تدوین کامل نیست. تصویر، قاب و بازی اصلی از ویدیوی شما می‌آیند؛ صدای جدید فقط حرکت لب را دوباره هدایت می‌کند.

قبل

ویدیوی اصلی

چهره، نور، حرکت دوربین و اجرای بدن

بعد

همان ویدیو با دیالوگ جدید

حرکت لب متناسب با گفتار جدید بازسازی می‌شود

قبل از آپلود

چه فایل‌هایی می‌توان به Kling LipSync داد؟

محدودیت‌های زیر مربوط به مسیرهای مرجع fal هستند؛ پشتیبانی فعال و اعتبار نهایی در استودیوی جنارا نمایش داده می‌شود.

ویدیوی ورودی۲ تا ۱۰ ثانیه

MP4 یا MOV · حداکثر ۱۰۰ مگابایت

کیفیت ویدیو720p یا 1080p

عرض و ارتفاع بین ۷۲۰ تا ۱۹۲۰ پیکسل

فایل صوتی۲ تا ۶۰ ثانیه

MP3، WAV، M4A، AAC یا OGG · حداکثر ۵ مگابایت

خروجیهمان صحنه

دیالوگ عوض می‌شود؛ قاب و بازی اصلی حفظ می‌شوند

کلیپ مناسبچهره نسبتا بزرگ، دهان بدون پوشیدگی، نور یکنواخت و حرکت دوربین کم
صدای مناسبیک گوینده، بدون نویز و موسیقی بلند، با حجم ثابت و مکث طبیعی
انتخاب مسیر

فایل صوتی دارید یا فقط متن؟

روی هر مسیر بزنید تا ورودی و خروجی دقیق آن را ببینید.

فایل صوتی

ویدیوی آماده را با صدای جدید هماهنگ کنید

ورودی
۱ ویدیوی چهره + ۱ فایل صوتی
خروجی
همان کلیپ با حرکت لب هماهنگ با صدای جدید

بهترین مسیر برای دوبله فارسی، بازنویسی دیالوگ و اصلاح صدای کلیپ است.

برای فارسی، مسیر فایل صوتی یا تبدیل متن به گفتار در جنارا انتخاب شفاف‌تری است.
راهنمای انتخاب Kling LipSync

Kling LipSync برای چه ویدیوهایی مناسب است؟

اگر یک ویدیوی آماده و صدای تازه دارید، Kling LipSync حرکت لب شخصیت را با دیالوگ یا آواز جدید هماهنگ می‌کند. پایین‌تر می‌توانید تفاوت آن را با Sync و VEED ببینید.

کلیپ کوتاه و مسیر سادهKling LipSync

برای دوبله و تغییر دیالوگ یک ویدیوی کوتاه با فایل صوتی یا متن.

ورودی
ویدیو + فایل صوتی؛ یا ویدیو + متن و صدای آماده Kling
خروجی
همان کلیپ با حرکت لب هماهنگ
مناسب برای
دوبله کوتاه، اصلاح جمله و محتوای شبکه اجتماعی
کنترل‌ها
در مسیر صوتی کنترل از فایل صدا می‌آید؛ مسیر متن از صداهای آماده Kling استفاده می‌کند.
محدودیت شاخص
ویدیوی صوتی ۲ تا ۱۰ ثانیه · 720p یا 1080p
قیمت مرجع fal
۰٫۰۱۴ دلار برای هر ثانیه ویدیوی ورودی؛ گردکردن رو به بازه ۵ ثانیه
Audio to VideoText to Video
مشاهده مشخصات رسمی در fal
شروع در جنارا

از کلیپ آماده تا دوبله هماهنگ

مسیر فعلی: فایل صوتی

  1. ۰۱
    ویدیوی چهره را اضافه کنید

    ۲ تا ۱۰ ثانیه، دهان واضح و بدون برش سریع

  2. ۰۲
    فایل صوتی را وارد کنید

    یک گوینده با صدای تمیز و مکث طبیعی

  3. ۰۳
    زمان‌بندی را هماهنگ کنید

    سکوت اضافه را ببرید و طول جمله را به کلیپ نزدیک کنید

  4. ۰۴
    خروجی را بسازید

    حرکت لب، تلفظ و پایان کلیپ را بازبینی کنید

ادامه با فایل صوتی
کاربردهای واقعی

با Kling LipSync چه می‌توان ساخت؟

۰۱

دوبله فارسی

دیالوگ یک ویدیوی خارجی را با صدای فارسی جایگزین کنید.

کلیپ چهره + صدای دوبله
۰۲

اصلاح یک جمله

بدون فیلم‌برداری دوباره، جمله اشتباه یا قدیمی را عوض کنید.

همان کلیپ + صدای اصلاح‌شده
۰۳

نسخه چندزبانه

از یک اجرای تصویری، نسخه‌های صوتی برای بازارهای مختلف بسازید.

یک ویدیو + چند فایل صوتی
۰۴

تبلیغ و شبکه اجتماعی

پیام یا پیشنهاد کمپین را روی کلیپ موجود به‌روزرسانی کنید.

ویدیوی تبلیغ + متن تازه
۰۵

آموزش و راهنما

نریشن مدرس یا راهنمای محصول را بدون ضبط دوباره تصویر اصلاح کنید.

ویدیوی مدرس + صدای جدید
۰۶

شخصیت و محتوای سرگرمی

برای کاراکتر یا چهره مجاز، دیالوگ تازه و هماهنگ بسازید.

کلیپ واضح + دیالوگ کوتاه
انتخاب ابزار درست

لب‌سینک، آواتار، کنترل حرکت یا Kling 3.0؟

فایل موجود و چیزی که می‌خواهید تغییر کند، مسیر مناسب را مشخص می‌کند.

تغییر دیالوگ ویدیوی آماده

Kling LipSync

ورودی
ویدیوی چهره + صدا یا متن
خروجی
همان ویدیو با لب هماهنگ
مناسب برای
دوبله، اصلاح جمله و نسخه چندزبانه
همین صفحه
ساخت سخنگو از تصویر

Kling AI Avatar

ورودی
تصویر + صدا + پرامپت اختیاری
خروجی
ویدیوی سخنگوی تازه
مناسب برای
وقتی ویدیوی اولیه ندارید
مشاهده صفحه مدل
انتقال حرکت بدن

Kling Motion Control

ورودی
تصویر شخصیت + ویدیوی حرکت
خروجی
شخصیت با اجرای مرجع
مناسب برای
رقص، ورزش و اجرای تمام‌قد
مشاهده صفحه مدل
ساخت و ویرایش کامل صحنه

Kling 3.0

ورودی
متن، تصویر، ویدیو یا چند رفرنس
خروجی
صحنه تازه یا ویرایش‌شده
مناسب برای
روایت، تبلیغ و کنترل دوربین
مشاهده صفحه مدل
رفع خطا

اگر لب و صدا طبیعی نبود، چه چیزی را اصلاح کنیم؟

۰۱

لب از صدا عقب یا جلو است

علت محتمل: شروع فایل صوتی سکوت دارد یا ریتم گفتار با کلیپ خیلی متفاوت است

راه‌حل: سکوت ابتدا و انتهای صدا را کوتاه کنید و طول دیالوگ را به اجرای اصلی نزدیک نگه دارید.

۰۲

دهان مصنوعی یا لرزان شده

علت محتمل: صورت کوچک، زاویه زیاد یا دهان پوشیده است

راه‌حل: کلیپی با چهره بزرگ‌تر، نور یکنواخت و دهان کاملا قابل‌دیدن انتخاب کنید.

۰۳

بخشی از جمله نامفهوم است

علت محتمل: نویز، موسیقی بلند یا هم‌پوشانی چند گوینده

راه‌حل: صدای یک گوینده را جدا کنید، نویز را کم کنید و حجم گفتار را یکنواخت نگه دارید.

۰۴

پایان ویدیو و صدا هماهنگ نیست

علت محتمل: مدت دیالوگ با فضای زمانی کلیپ تناسب ندارد

راه‌حل: پیش از ساخت، صدا را کوتاه یا کلیپ را در تدوین هم‌اندازه کنید و نتیجه را بازبینی کنید.

پرسش‌های متداول

پیش از شروع با Kling LipSync

Kling LipSync چیست؟

ابزاری برای هماهنگ‌کردن حرکت لب در یک ویدیوی موجود با فایل صوتی یا گفتار تازه است. برخلاف آواتار، صحنه را از یک عکس نمی‌سازد؛ همان کلیپ را نگه می‌دارد و دیالوگ آن را تغییر می‌دهد.

ورودی‌های Kling LipSync دقیقا چیست؟

در مسیر صوتی، یک ویدیوی چهره و یک فایل صوتی لازم است. ویدیو باید MP4 یا MOV، بین ۲ تا ۱۰ ثانیه، حداکثر ۱۰۰ مگابایت و با کیفیت 720p یا 1080p باشد. فایل صوتی می‌تواند ۲ تا ۶۰ ثانیه و حداکثر ۵ مگابایت باشد.

Kling LipSync با صدای فارسی کار می‌کند؟

بله، در مسیر فایل صوتی می‌توانید گفتار فارسی وارد کنید. کیفیت ضبط، واضح‌بودن تلفظ و نبود موسیقی بلند از زبان پرامپت مهم‌تر است. زبان صدا با زبان توضیح یا پرامپت دو موضوع جدا هستند.

می‌توان به‌جای فایل صوتی، متن فارسی نوشت؟

در جنارا بله. متن فارسی ابتدا با صدای انتخابی شما به فایل صوتی تبدیل می‌شود و سپس آن صدا وارد مسیر LipSync می‌شود. مسیر مستقیم متن در ارائه‌دهنده مرجع فقط انگلیسی و چینی را فهرست می‌کند، بنابراین برای فارسی مسیر تبدیل متن به صدا شفاف‌تر است.

مسیر فایل صوتی و متن چه فرقی دارند؟

اگر صدای نهایی را دارید، فایل صوتی کنترل مستقیم‌تری روی لحن، مکث و تلفظ می‌دهد. اگر فقط متن دارید، جنارا آن را به گفتار تبدیل می‌کند و بعد همان فرایند هماهنگی لب اجرا می‌شود.

اگر طول صدا و ویدیو متفاوت باشد چه کنیم؟

مشخصات ورودی اجازه می‌دهد طول صدا و ویدیو یکسان نباشد، اما برای نتیجه طبیعی بهتر است دیالوگ را با فضای زمانی کلیپ هماهنگ کنید. سکوت اضافه را ببرید، جمله را کوتاه کنید و پایان خروجی را پیش از انتشار بازبینی کنید.

چه ویدیویی برای لب‌سینک بهتر است؟

چهره و دهان باید واضح، نسبتا بزرگ و بدون پوشیدگی باشند. نور یکنواخت، حرکت دوربین کم، زاویه روبه‌رو یا سه‌رخ ملایم و نبود برش سریع معمولا نتیجه پایدار‌تری می‌دهد.

Kling LipSync با Kling AI Avatar چه فرقی دارد؟

LipSync برای کلیپ آماده است و فقط دیالوگ و حرکت لب را هماهنگ می‌کند. AI Avatar از یک تصویر ثابت و صدا، ویدیوی سخنگوی تازه می‌سازد. اگر ویدیو دارید LipSync؛ اگر فقط عکس دارید Avatar را انتخاب کنید.

ساخت با Kling LipSync در جنارا چقدر اعتبار مصرف می‌کند؟

اعتبار نهایی پیش از ساخت در استودیو نمایش داده می‌شود. قیمت مرجع fal در زمان بازبینی ۰٫۰۱۴ دلار برای هر ثانیه ویدیوی ورودی است و مدت برای محاسبه به نزدیک‌ترین بازه ۵ ثانیه رو به بالا گرد می‌شود؛ این عدد معادل اعتبار جنارا نیست.

آیا استفاده تجاری از خروجی مجاز است؟

شرایط استفاده به حساب جنارا، ارائه‌دهنده فعال و حقوق محتوای ورودی بستگی دارد. برای چهره و صدای اشخاص، موسیقی، لوگو و محتوای دارای حق نشر باید مجوز و رضایت لازم را داشته باشید؛ از LipSync برای جعل هویت یا نسبت‌دادن سخن به افراد بدون رضایت استفاده نکنید.

کلیپ و دیالوگ آماده‌اند؟

همان اجرا را نگه دارید و فقط گفت‌وگو را عوض کنید.

شروع با Kling LipSync