ElevenLabs میتواند متن را به گفتار تبدیل کند، برای یک شخصیت صدای تازه طراحی کند، با رضایت صاحب صدا نمونهای شبیه صدای او بسازد یا ویدیوی موجود را دوبله کند. این کارها شبیه هم به نظر میرسند، اما ورودی و خروجی یکسانی ندارند. ابتدا مشخص کنید فایل صوتی تازه میخواهید، هویت صوتی ثابت، دوبله یا فقط متن و زیرنویس.
در این راهنما یک سناریوی پیشنهادی را دنبال میکنیم: ساخت گویندگی فارسی برای ویدیوی معرفی یک اپلیکیشن. متن آماده است، گوینده واقعی نداریم و در پایان یک فایل صوتی تأییدشده میخواهیم که بتوان آن را روی ویدیو یا آواتار گذاشت.
Text to Speech، Voice Design، Voice Cloning و Dubbing چه فرقی دارند؟
| قابلیت | ورودی | خروجی | زمان انتخاب |
|---|---|---|---|
| تبدیل متن به گفتار (Text to Speech) | متن + انتخاب صدا | فایل صوتی تازه | وقتی متن دارید و فقط گویندگی میخواهید |
| طراحی صدا (Voice Design) | توضیح ویژگیهای صدا | یک صدای مصنوعی تازه | وقتی شخصیت برند هنوز صدای مشخصی ندارد |
| کلون صدا (Voice Cloning) | نمونه صدای مجاز | متن تازه با هویت صوتی مشابه | فقط با رضایت روشن صاحب صدا |
| دوبله (Dubbing) | صوت یا ویدیوی دارای گفتار | نسخه گفتاری به زبان مقصد | وقتی محتوای موجود باید فارسی شود |
| تبدیل گفتار به متن (Speech to Text) | صوت یا ویدیو | متن و زمانبندی | برای زیرنویس، بازبینی یا جستوجو در گفتار |
لیپسینک (Lip Sync) مرحله دیگری است: فایل صوتی را تولید نمیکند؛ حرکت لب یک تصویر یا ویدیو را با صدای نهایی هماهنگ میکند. پس ابتدا صدا را تأیید کنید و بعد سراغ ویدیو بروید.
از روی فایلهایی که دارید، کدام مسیر را در جنارا انتخاب کنید؟
Eleven v3 را برای ساخت گفتار امتحان کنید. خروجی را روی نام برند، عددها و مکثها گوش کنید.
با Voice Design یک صدای تازه بسازید؛ سپس همان صدا را روی چند جمله واقعی فارسی آزمایش کنید.
Voice Cloning برای ثبات هویت صوتی است. نمونه باید تکگوینده، بدون موسیقی و با رضایت قابلاثبات باشد.
Dubbing گفتار را فارسی میکند. اگر دهان گوینده هم باید با فارسی هماهنگ شود، صدای خروجی را بعداً به ابزار لیپسینک بدهید.
یک گویندگی فارسی را چطور بسازیم و قبل از ویدیو تأیید کنیم؟
متن را برای شنیدن بازنویسی کنید
جمله کوتاه، یک پیام اصلی و نقطهگذاری طبیعی داشته باشید. متن صفحه وب معمولاً بدون ویرایش، گفتار خوبی نمیشود.
یک نمونه کوتاه با Eleven v3 بسازید
در جنارا مسیر متنبهگفتار را باز کنید، صدا را انتخاب کنید و ابتدا فقط یک یا دو جمله بسازید.
چهار نقطه را گوش کنید
نام برند، عدد و تاریخ، واژه انگلیسی و محل مکث. اگر یکی غلط است، فقط همان بخش متن یا نشانهگذاری را اصلاح کنید.
فایل تأییدشده را قفل کنید
همین فایل باید وارد تدوین، Avatar یا Lip Sync شود؛ تغییر صدا بعد از ساخت ویدیو دوبارهکاری ایجاد میکند.
هزینههای روزانهات کجا میروند؟ با گزارش سادهٔ هفتگی، خرجهای مهم را یکجا ببین و برای هفتهٔ بعد تصمیم بگیر.
اگر «گزارش هفتگی» خیلی سریع خوانده شد، جمله را طولانیتر نکنید. یک مکث طبیعی با نقطه یا شکست جمله بسازید و دوباره همان بخش را آزمایش کنید. تگهای اجرایی را فقط وقتی استفاده کنید که مدل و صدای انتخابی از آنها پشتیبانی میکنند.
چه زمانی دوبله بهتر است و چه زمانی باید صدا را از نو بسازیم؟
اگر ویدیوی اصلی، گوینده و زمانبندی مشخص دارد، Dubbing نقطه شروع منطقی است؛ چون ساختار گفتار را حفظ میکند. اگر قرار است پیام، لحن یا طول جملهها کاملاً تغییر کند، گویندگی تازه کنترل بیشتری میدهد. دوبله بهتنهایی تضمین نمیکند حرکت لب با فارسی هماهنگ شود.
اگر صدای فارسی مصنوعی، تند یا ناهماهنگ است چه کنیم؟
کلون صدا را چطور مسئولانه استفاده کنیم؟
کلون صدا فقط یک انتخاب فنی نیست. برای صدای یک فرد واقعی، رضایت روشن، هدف استفاده و امکان پسگرفتن اجازه را مشخص کنید. از صدای افراد شناختهشده یا همکاران بدون اجازه برای تبلیغ، تقلید هویت یا پیام ساختگی استفاده نکنید. برای شخصیت خیالی برند، Voice Design معمولاً مرز حقوقی روشنتری دارد.
مسیر کوتاه انتخاب ابزار
سؤالهای رایج درباره ساخت صدای فارسی با ElevenLabs
آیا ElevenLabs خودش ویدیو را لیپسینک میکند؟
خیر؛ ابتدا صدا را تولید یا دوبله میکنید و سپس فایل نهایی را به مدل لیپسینک یا آواتار میدهید.
Voice Design با Voice Cloning چه تفاوتی دارد؟
Voice Design یک صدای مصنوعی تازه از روی توضیح میسازد. Voice Cloning ویژگیهای صدای یک فرد واقعی را از نمونه مجاز بازسازی میکند.
برای طبیعیترشدن فارسی چه چیزی مهمتر است؟
متن شنیداری، جمله کوتاه، تلفظ نامها و بازبینی نمونه کوتاه معمولاً از یک دستور طولانی مفیدتر است.



