یک تصویر، یک صدا، یک اجرای طبیعی

ساخت آواتار سخنگو با Kling AI Avatar

یک تصویر و صدای گوینده را وارد کنید؛ Kling Avatar v2 همان شخصیت را با حرکت لب، حالت چهره و اجرای هماهنگ به ویدیو تبدیل می‌کند.

اگر ویدیوی آماده دارید و فقط دیالوگ آن عوض می‌شود، مسیر Kling LipSync مناسب‌تر است.

ورودی‌های واقعی مدل
Kling AI Avatar
تصویر آواتارلازم
صدای گفتارلازم
متن و پرامپت
پرامپت اجرای شخصیت

با لحن گرم، تماس چشمی و حرکت سر طبیعی صحبت کند.

اختیاری
حالت چهره، تماس چشمی و شیوه اجرای شخصیت را کوتاه مشخص کنید.
تنظیمات کلیدی
Standard یا Proمدت هماهنگ با صدایک گویندهپرامپت اجرا اختیاری
شروع با تصویر و فایل صوتی
۱ تصویرهویت و ظاهر شخصیت
۱ فایل صوتیدیالوگ، ریتم و زمان خروجی
پرامپت اختیاریاحساس، حالت و ژست
دو نسخهStandard برای تست · Pro برای انتشار
تعریف ساده

هر ورودی چه چیزی را کنترل می‌کند؟

تصویر آواتار

ظاهر را ثابت می‌کند

چهره، لباس، سبک تصویر و پس‌زمینه از همین قاب شروع می‌شوند.

فایل صوتی

گفتار و زمان را می‌سازد

کلمات، مکث‌ها، سرعت و طول صدا، زمان و حرکت لب را هدایت می‌کنند.

پرامپت اجرا

بازی شخصیت را هدایت می‌کند

احساس، تماس چشمی، حرکت سر، ژست و شدت اجرای شخصیت را کوتاه توضیح دهید.

قبل از ساخت

تصویر و صدا را چطور آماده کنیم؟

کیفیت ورودی بیشتر از طول پرامپت روی ثبات چهره و هماهنگی لب اثر دارد.

تصویر مناسب

چهره خوانا، نور نرم و فضای کافی

  • صورت رو‌به‌رو یا سه‌رخ ملایم
  • چشم و دهان بدون پوشیدگی
  • سر و شانه کامل داخل قاب
  • پس‌زمینه ساده و بدون نوشته
صدای مناسب

گفتار واضح، حجم ثابت و مکث طبیعی

  • بدون موسیقی یا نویز بلند
  • یک گوینده در هر فایل
  • تلفظ روشن نام‌ها و اعداد
  • جمله‌های کوتاه برای تست اول
کارگردانی اجرا

می‌خواهید شخصیت چطور صحبت کند؟

برای هر نوع اجرا، یک پرامپت آماده و نکته قاب‌بندی ببینید.

مدرس آرام

واضح، شمرده و قابل اعتماد

نمونه پرامپت اجرا
با لحن آرام و حرفه‌ای صحبت کند؛ تماس چشمی با دوربین، لبخند ملایم و حرکت محدود دست‌ها.

نکته تولید: برای آموزش و توضیح محصول، قاب سینه به بالا و حرکت کم نتیجه خواناتری می‌دهد.

انتخاب نسخه

Standard یا Pro؟

ورودی هر دو یکسان است. Standard برای تست کم‌هزینه و تولید پرتعداد است؛ Pro جزئیات چهره و لب‌سینک بهتر را برای انتشار نهایی در اولویت می‌گذارد.

برای تست و تولید پرتعداد

Kling Avatar v2 · Standard

اگر هنوز تصویر، صدا یا پرامپت را آزمایش می‌کنید، با Standard شروع کنید.

کیفیت
هزینه کمتر برای هر ثانیه
مناسب برای
تست شخصیت، محتوای پرتعداد و شبکه اجتماعی
تعرفه مرجع fal
۰٫۰۵۶۲ دلار برای هر ثانیه
تعرفه fal فقط برای مقایسه نسخه‌هاست و معادل اعتبار جنارا نیست. هزینه فعال پیش از ساخت در استودیو نمایش داده می‌شود.
شروع در جنارا

از تصویر و صدا تا آواتار سخنگو

مسیر فعلی: فایل صوتی · Standard

  1. ۰۱
    تصویر آواتار را اضافه کنید

    چهره واضح، نور یکنواخت و سر و شانه داخل قاب

  2. ۰۲
    فایل صوتی را وارد کنید

    صدای یک گوینده، بدون نویز و با مکث طبیعی

  3. ۰۳
    نسخه و اجرای شخصیت را انتخاب کنید

    Standard · مدرس آرام

  4. ۰۴
    خروجی را بسازید

    حرکت لب، هویت چهره، دست‌ها و پایان صدا را بازبینی کنید

ادامه با Standard
کاربردهای واقعی

با Kling AI Avatar چه می‌توان ساخت؟

۰۱

مدرس مجازی

درس، راهنمای محصول و پاسخ‌های پرتکرار را با یک مدرس ثابت منتشر کنید.

تصویر مدرس + صدای درس
۰۲

سخنگوی برند

یک چهره ثابت برای معرفی محصول، خبر سازمانی و پیام‌های چندزبانه بسازید.

پرتره برند + نریشن
۰۳

ویدیوی شبکه اجتماعی

از یک شخصیت ثابت، نسخه‌های کوتاه عمودی با اجرای صوت‌محور تولید کنید.

تصویر عمودی + صدای کوتاه
۰۴

پشتیبانی و راهنما

راهنمای استفاده و پاسخ‌های خدمات مشتری را با لحن یکسان ارائه دهید.

آواتار رسمی + متن یا صدا
۰۵

شخصیت کارتونی

کاراکتر دوبعدی یا سه‌بعدی را بدون ساخت ریگ دستی به حرف درآورید.

تصویر کاراکتر + دیالوگ
۰۶

حیوان سخنگو

برای محتوای سرگرمی و کمپین، حیوان یا مسکات برند را گوینده کنید.

تصویر واضح حیوان + صدا
انتخاب ابزار درست

آواتار، لب‌سینک، کنترل حرکت یا Kling 3.0؟

اول ببینید چه فایل‌هایی دارید و دقیقا کدام بخش اجرا باید تغییر کند.

ساخت ویدیوی سخنگو از تصویر

Kling AI Avatar

ورودی
۱ تصویر + ۱ فایل صوتی + پرامپت اختیاری
خروجی
ویدیوی تازه با حرکت لب، صورت و اجرای شخصیت
مناسب برای
مدرس، سخنگوی برند، کاراکتر و حیوان سخنگو
همین صفحه
هماهنگ‌کردن لب در ویدیوی موجود

Kling LipSync

ورودی
ویدیوی چهره + صدا یا متن
خروجی
همان ویدیو با حرکت لب هماهنگ
مناسب برای
دوبله و تغییر دیالوگ یک کلیپ آماده
مشاهده صفحه مدل
انتقال حرکت بدن

Kling Motion Control

ورودی
تصویر شخصیت + ویدیوی حرکت
خروجی
ظاهر تصویر با اجرای بدن ویدیوی مرجع
مناسب برای
رقص، ورزش، فشن و مجری تمام‌قد
مشاهده صفحه مدل
ساخت یا ویرایش کامل صحنه

Kling 3.0

ورودی
متن، تصویر، ویدیو یا چند رفرنس
خروجی
صحنه تازه، چندشاتی یا ویرایش‌شده
مناسب برای
روایت سینمایی، تبلیغ و کنترل دوربین
مشاهده صفحه مدل
رفع خطا

اگر خروجی طبیعی نبود، چه چیزی را تغییر دهیم؟

نشانه را پیدا کنید و پیش از تغییر نسخه، ورودی مرتبط با همان مشکل را اصلاح کنید.

۰۱

لب‌ها دقیق با صدا هماهنگ نیستند

علت محتمل: صدای پرنویز، موسیقی بلند یا تلفظ نامشخص

راه‌حل: صدای گفتار را جدا، شفاف و با حجم ثابت وارد کنید؛ مکث‌ها را طبیعی نگه دارید.

۰۲

چهره یا هویت در طول اجرا تغییر می‌کند

علت محتمل: تصویر تاریک، زاویه خیلی مایل یا صورت کوچک

راه‌حل: یک تصویر واضح رو‌به‌رو یا سه‌رخ ملایم با نور یکنواخت و صورت بزرگ‌تر انتخاب کنید.

۰۳

حالت چهره مصنوعی یا بیش‌ازحد است

علت محتمل: پرامپت طولانی یا چند احساس متناقض

راه‌حل: یک احساس اصلی و یک یا دو حرکت محدود بنویسید؛ مثلا لبخند ملایم و تماس چشمی.

۰۴

دست یا بدن از قاب خارج می‌شود

علت محتمل: قاب بسته همراه دستور حرکت زیاد

راه‌حل: قاب بازتر انتخاب کنید یا پرامپت را به حرکت نرم سر و شانه محدود کنید.

پرسش‌های متداول

پیش از شروع با Kling AI Avatar

Kling AI Avatar چیست؟

مدل تخصصی Kuaishou برای ساخت ویدیوی سخنگو از یک تصویر و یک فایل صوتی است. تصویر ظاهر شخصیت را مشخص می‌کند، صدا زمان و حرکت لب را هدایت می‌کند و پرامپت اختیاری، احساس و اجرای شخصیت را توضیح می‌دهد.

ورودی‌های Kling Avatar v2 دقیقا چیست؟

در مسیر مستقیم مدل، یک تصویر آواتار و یک فایل صوتی اجباری‌اند و یک پرامپت اجرا اختیاری است. خروجی یک فایل ویدیویی است که مدت آن با طول صدای ورودی هماهنگ می‌شود.

می‌توان به‌جای فایل صوتی، متن فارسی نوشت؟

در خود مدل Avatar v2 ورودی اصلی صداست. در جنارا می‌توانید متن فارسی را به گفتار تبدیل کنید و سپس همان صدا را به مدل بدهید. زبان متن و زبان پرامپت اجرا دو موضوع جدا هستند.

Kling AI Avatar با صدای فارسی کار می‌کند؟

صدای ورودی مستقیما ریتم و حرکت لب را هدایت می‌کند؛ بنابراین می‌توانید فایل گفتار فارسی وارد کنید. ضبط تمیز، تلفظ واضح و موسیقی پس‌زمینه کم برای نتیجه بهتر مهم‌تر از طول پرامپت‌اند.

Standard و Pro چه تفاوتی دارند؟

ورودی هر دو نسخه یک تصویر، یک فایل صوتی و پرامپت اختیاری است. Standard با هزینه کمتر برای تست و تولید پرتعداد مناسب است. Pro جزئیات چهره و دقت لب‌سینک را بهتر می‌کند و برای انتشار نهایی، آموزش و محتوای برند مناسب‌تر است. اگر مطمئن نیستید، ابتدا با Standard تست بگیرید.

چه تصویری برای آواتار مناسب است؟

تصویر واضح با صورت قابل‌تشخیص، نور یکنواخت و بدون پوشیدگی انتخاب کنید. پرتره رو‌به‌رو یا سه‌رخ ملایم، فضای کافی اطراف سر و شانه و پس‌زمینه ساده معمولا نتیجه پایدار‌تری می‌دهد.

آیا فقط چهره انسان پشتیبانی می‌شود؟

خیر. Kling Avatar v2 برای انسان واقعی، شخصیت کارتونی، تصویر سبک‌دار و حیوان نیز معرفی شده است. چشم و دهان کاراکتر باید در تصویر واضح باشند تا مدل بتواند اجرای صوتی را بهتر بازسازی کند.

Kling AI Avatar چه فرقی با Kling LipSync دارد؟

Avatar از یک تصویر ثابت، ویدیوی سخنگوی تازه با حرکت صورت و اجرای شخصیت می‌سازد. LipSync یک ویدیوی موجود را می‌گیرد و فقط حرکت لب آن را با صدای جدید هماهنگ می‌کند. اگر کلیپ آماده دارید LipSync؛ اگر فقط تصویر دارید Avatar مناسب‌تر است.

ساخت آواتار در جنارا چقدر اعتبار مصرف می‌کند؟

هزینه به طول صدا و نسخه انتخابی بستگی دارد. قیمت مرجع fal در زمان بازبینی برای Standard برابر ۰٫۰۵۶۲ دلار و برای Pro برابر ۰٫۱۱۵ دلار برای هر ثانیه است. این قیمت‌ها اعتبار جنارا نیستند؛ هزینه نهایی پیش از ساخت در استودیو نمایش داده می‌شود.

آیا می‌توان از خروجی Kling AI Avatar تجاری استفاده کرد؟

شرایط استفاده تجاری به حساب جنارا، ارائه‌دهنده فعال و حقوق تصویر و صدا بستگی دارد. برای چهره افراد، صدای اشخاص، لوگو، موسیقی و شخصیت‌های دارای حق نشر باید مجوز لازم را داشته باشید و رضایت صاحب چهره و صدا را بررسی کنید.

چهره و صدا آماده‌اند؟

با Standard تست کنید؛ برای انتشار نهایی Pro را انتخاب کنید.

شروع با Kling AI Avatar