ساخت ویدیو

راهنمای متن‌به‌گفتار، دوبله و استفاده مجاز از صدا

ساخت صدای فارسی با ElevenLabs؛ از متن تا دوبله و کلون صدا

فرق ساخت صدا، Voice Design، کلون صدا، دوبله و لیپ‌سینک را یاد بگیرید و بر اساس متن، نمونه صوتی یا ویدیوی موجود، مسیر مناسب جنارا را انتخاب کنید.

راهنمای ساخت صدای فارسی با هوش مصنوعی و ElevenLabs در جنارا؛ از متن تا دوبله و صدای شخصیت
راهنمای انتخاب مسیر ساخت صدا، دوبله و زیرنویس فارسی در جناراجنارا

ElevenLabs می‌تواند متن را به گفتار تبدیل کند، برای یک شخصیت صدای تازه طراحی کند، با رضایت صاحب صدا نمونه‌ای شبیه صدای او بسازد یا ویدیوی موجود را دوبله کند. این کارها شبیه هم به نظر می‌رسند، اما ورودی و خروجی یکسانی ندارند. ابتدا مشخص کنید فایل صوتی تازه می‌خواهید، هویت صوتی ثابت، دوبله یا فقط متن و زیرنویس.

در این راهنما یک سناریوی پیشنهادی را دنبال می‌کنیم: ساخت گویندگی فارسی برای ویدیوی معرفی یک اپلیکیشن. متن آماده است، گوینده واقعی نداریم و در پایان یک فایل صوتی تأییدشده می‌خواهیم که بتوان آن را روی ویدیو یا آواتار گذاشت.

Text to Speech، Voice Design، Voice Cloning و Dubbing چه فرقی دارند؟

قابلیتورودیخروجیزمان انتخاب
تبدیل متن به گفتار (Text to Speech)متن + انتخاب صدافایل صوتی تازهوقتی متن دارید و فقط گویندگی می‌خواهید
طراحی صدا (Voice Design)توضیح ویژگی‌های صدایک صدای مصنوعی تازهوقتی شخصیت برند هنوز صدای مشخصی ندارد
کلون صدا (Voice Cloning)نمونه صدای مجازمتن تازه با هویت صوتی مشابهفقط با رضایت روشن صاحب صدا
دوبله (Dubbing)صوت یا ویدیوی دارای گفتارنسخه گفتاری به زبان مقصدوقتی محتوای موجود باید فارسی شود
تبدیل گفتار به متن (Speech to Text)صوت یا ویدیومتن و زمان‌بندیبرای زیرنویس، بازبینی یا جست‌وجو در گفتار

لیپ‌سینک (Lip Sync) مرحله دیگری است: فایل صوتی را تولید نمی‌کند؛ حرکت لب یک تصویر یا ویدیو را با صدای نهایی هماهنگ می‌کند. پس ابتدا صدا را تأیید کنید و بعد سراغ ویدیو بروید.

از روی فایل‌هایی که دارید، کدام مسیر را در جنارا انتخاب کنید؟

فقط متن دارید

Eleven v3 را برای ساخت گفتار امتحان کنید. خروجی را روی نام برند، عددها و مکث‌ها گوش کنید.

ایده شخصیت دارید، اما صدا ندارید

با Voice Design یک صدای تازه بسازید؛ سپس همان صدا را روی چند جمله واقعی فارسی آزمایش کنید.

نمونه صدای مجاز دارید

Voice Cloning برای ثبات هویت صوتی است. نمونه باید تک‌گوینده، بدون موسیقی و با رضایت قابل‌اثبات باشد.

ویدیوی خارجی دارید

Dubbing گفتار را فارسی می‌کند. اگر دهان گوینده هم باید با فارسی هماهنگ شود، صدای خروجی را بعداً به ابزار لیپ‌سینک بدهید.

یک گویندگی فارسی را چطور بسازیم و قبل از ویدیو تأیید کنیم؟

متن را برای شنیدن بازنویسی کنید

جمله کوتاه، یک پیام اصلی و نقطه‌گذاری طبیعی داشته باشید. متن صفحه وب معمولاً بدون ویرایش، گفتار خوبی نمی‌شود.

یک نمونه کوتاه با Eleven v3 بسازید

در جنارا مسیر متن‌به‌گفتار را باز کنید، صدا را انتخاب کنید و ابتدا فقط یک یا دو جمله بسازید.

چهار نقطه را گوش کنید

نام برند، عدد و تاریخ، واژه انگلیسی و محل مکث. اگر یکی غلط است، فقط همان بخش متن یا نشانه‌گذاری را اصلاح کنید.

فایل تأییدشده را قفل کنید

همین فایل باید وارد تدوین، Avatar یا Lip Sync شود؛ تغییر صدا بعد از ساخت ویدیو دوباره‌کاری ایجاد می‌کند.

متن تمرینی معرفی اپلیکیشن
هزینه‌های روزانه‌ات کجا می‌روند؟ با گزارش سادهٔ هفتگی، خرج‌های مهم را یک‌جا ببین و برای هفتهٔ بعد تصمیم بگیر.

اگر «گزارش هفتگی» خیلی سریع خوانده شد، جمله را طولانی‌تر نکنید. یک مکث طبیعی با نقطه یا شکست جمله بسازید و دوباره همان بخش را آزمایش کنید. تگ‌های اجرایی را فقط وقتی استفاده کنید که مدل و صدای انتخابی از آن‌ها پشتیبانی می‌کنند.

چه زمانی دوبله بهتر است و چه زمانی باید صدا را از نو بسازیم؟

اگر ویدیوی اصلی، گوینده و زمان‌بندی مشخص دارد، Dubbing نقطه شروع منطقی است؛ چون ساختار گفتار را حفظ می‌کند. اگر قرار است پیام، لحن یا طول جمله‌ها کاملاً تغییر کند، گویندگی تازه کنترل بیشتری می‌دهد. دوبله به‌تنهایی تضمین نمی‌کند حرکت لب با فارسی هماهنگ شود.

تصمیم کاربردی: اول صدای دوبله را بدون تصویر گوش کنید. اگر متن و تلفظ درست نیست، رفتن به مرحله لیپ‌سینک فقط خطا را گران‌تر می‌کند.

اگر صدای فارسی مصنوعی، تند یا ناهماهنگ است چه کنیم؟

نشانهنام برند اشتباه خوانده می‌شود
آزموننام را در یک جمله کوتاه جدا کنید
اصلاحاملای شنیداری یا شکل فارسی نام را آزمایش کنید و نسخه تأییدشده را در متن ثابت نگه دارید.
نشانهگفتار نفس‌گیر و تند است
آزمونجمله را در محل تغییر معنا بشکنید
اصلاحبه‌جای افزودن صفت‌های بیشتر، جمله‌بندی و مکث را اصلاح کنید.
نشانهاحساس صدا با برند نمی‌خواند
آزمونیک متن ثابت را با دو صدای متفاوت بسازید
اصلاحصدا را بر اساس کاربرد انتخاب کنید، نه فقط جذابیت نمونه نمایشی.

کلون صدا را چطور مسئولانه استفاده کنیم؟

کلون صدا فقط یک انتخاب فنی نیست. برای صدای یک فرد واقعی، رضایت روشن، هدف استفاده و امکان پس‌گرفتن اجازه را مشخص کنید. از صدای افراد شناخته‌شده یا همکاران بدون اجازه برای تبلیغ، تقلید هویت یا پیام ساختگی استفاده نکنید. برای شخصیت خیالی برند، Voice Design معمولاً مرز حقوقی روشن‌تری دارد.

مسیر کوتاه انتخاب ابزار

متن → صداEleven v3 و بازبینی تلفظ
شخصیت → صدای تازهVoice Design و تست روی متن واقعی
نمونه مجاز → هویت صوتیVoice Cloning با رضایت
ویدیو خارجی → فارسیDubbing، سپس Lip Sync در صورت نیاز

سؤال‌های رایج درباره ساخت صدای فارسی با ElevenLabs

آیا ElevenLabs خودش ویدیو را لیپ‌سینک می‌کند؟

خیر؛ ابتدا صدا را تولید یا دوبله می‌کنید و سپس فایل نهایی را به مدل لیپ‌سینک یا آواتار می‌دهید.

Voice Design با Voice Cloning چه تفاوتی دارد؟

Voice Design یک صدای مصنوعی تازه از روی توضیح می‌سازد. Voice Cloning ویژگی‌های صدای یک فرد واقعی را از نمونه مجاز بازسازی می‌کند.

برای طبیعی‌ترشدن فارسی چه چیزی مهم‌تر است؟

متن شنیداری، جمله کوتاه، تلفظ نام‌ها و بازبینی نمونه کوتاه معمولاً از یک دستور طولانی مفیدتر است.