ویدیوهایی که صدای آنها با هوش مصنوعی ساخته یا کلون شده، این روزها در اینستاگرام و شبکههای اجتماعی زیاد دیده میشوند. با ElevenLabs میتوانید صدای خودتان یا صدایی را که اجازه استفاده از آن دارید شبیهسازی کنید و برای متن فارسی خروجی طبیعیتری بسازید.
ویدیوی همراه این آموزش را از طریق بخش رسانه سایت، بعد از مقدمه و در همین قسمت قرار دهید.
قبل از شروع؛ اجازه صاحب صدا ضروری است
فقط صدایی را کلون کنید که متعلق به خودتان است یا برای استفاده از آن رضایت روشن و قابلاثبات دارید. استفاده از صدای دیگران برای جعل هویت، فریب، کلاهبرداری، انتشار اطلاعات نادرست یا آسیبزدن به افراد قابلقبول نیست.
در Professional Voice Cloning محدودیت بیشتری وجود دارد: صاحب صدا باید فرایند تأیید صوتی را در حساب خودش انجام دهد. سپس در صورت نیاز میتواند صدای تأییدشده را به شکل خصوصی به حساب دیگری به اشتراک بگذارد.
Voice Cloning در ElevenLabs چیست؟
Voice Cloning یا شبیهسازی صدا به هوش مصنوعی اجازه میدهد ویژگیهایی مانند جنس صدا، ریتم صحبت، نوع ادای کلمات و لحن یک گوینده را از روی نمونه صوتی یاد بگیرد. بعد از ساختهشدن صدا، میتوانید متن جدیدی وارد کنید تا با صدایی شبیه نمونه مرجع خوانده شود.
کیفیت نمونه اولیه مستقیماً روی نتیجه اثر دارد. نویز، موسیقی، پژواک، صدای چند نفر یا تغییر شدید لحن ممکن است به خروجی منتقل شود.
Instant و Professional Voice Cloning چه تفاوتی دارند؟
Instant Voice Cloning
برای ساخت سریع یک صدا از نمونه کوتاه و تمیز مناسب است. هنگام ایجاد صدا باید تأیید کنید که حق استفاده از فایل و رضایت لازم را دارید. نتیجه معمولاً سریع آماده میشود و برای شروع، تولید محتوا و آزمایش صدا کاربردی است.
Professional Voice Cloning
برای شباهت و پایداری بیشتر طراحی شده و به نمونه صوتی طولانیتر و باکیفیتتر نیاز دارد. این روش شامل تأیید هویت صوتی است و صاحب صدا باید فرایند ساخت و تأیید را انجام دهد.
مرحله اول: نمونه صدای تمیز آماده کنید
برای Instant Voice Cloning یک تا دو دقیقه صدای واضح و پیوسته آماده کنید. کیفیت ضبط از طول زیاد فایل مهمتر است؛ بنابراین یک نمونه کوتاه و تمیز معمولاً بهتر از فایل طولانی، ناهماهنگ و پرنویز نتیجه میدهد.
- فقط صدای یک گوینده در فایل شنیده شود.
- موسیقی، صدای محیط، همهمه و افکتها حذف شوند.
- فاصله گوینده تا میکروفن و بلندی صدا ثابت باشد.
- پژواک اتاق و صدای باد یا برخورد میکروفن وجود نداشته باشد.
- لحن نمونه شبیه لحنی باشد که برای خروجی نهایی میخواهید.
- فایل را قبل از بارگذاری با هدفون بررسی کنید.
تمیزکردن نمونه با Adobe Podcast
اگر نمونه صوتی نویز، همهمه یا پژواک دارد، ابزار Adobe Podcast Enhance Speech میتواند گفتار را واضحتر کند. بهتر است ابتدا نسخه اصلی را نگه دارید و فایل پردازششده را جداگانه خروجی بگیرید.
شدت پاکسازی را بیش از حد بالا نبرید؛ پردازش سنگین ممکن است بافت طبیعی و جزئیات صدای گوینده را تغییر دهد. همیشه نتیجه را با فایل اصلی مقایسه کنید.
مراحل کلون کردن صدا در ElevenLabs
تولید صدای فارسی با Eleven v3
مدل Eleven v3 از زبان فارسی پشتیبانی میکند و برای اجرای طبیعیتر متن، انتقال احساس و کنترل بهتر لحن طراحی شده است. پس از انتخاب صدای کلونشده یا یکی از صداهای آماده، Eleven v3 را انتخاب کنید و متن فارسی را در بخش Text to Speech قرار دهید.
برای رسیدن به نتیجه بهتر، ابتدا چند جمله کوتاه تولید کنید و تلفظ واژههای مهم، سرعت خواندن و محل مکثها را بررسی کنید؛ سپس متن کامل را بسازید.
چطور متن فارسی طبیعیتری بنویسیم؟
- جملهها را کوتاه، روان و نزدیک به گفتار واقعی بنویسید.
- از ویرگول، نقطه، علامت سؤال و سهنقطه برای ایجاد مکث استفاده کنید.
- برای مکث طولانیتر، جمله را در یک خط جدا قرار دهید.
- عددها و مخففهای دشوار را با حروف فارسی بنویسید.
- برای واژههای چندتلفظی، فقط در صورت نیاز از فتحه، کسره، ضمه یا تشدید استفاده کنید.
- اگر واژهای اشتباه خوانده میشود، شکل نوشتاری آن را به تلفظ موردنظر نزدیک کنید.
- متنهای طولانی را به چند بخش کوتاه تقسیم و جداگانه آزمایش کنید.
پیداکردن صدای آماده و بم در Voice Library
اگر نمیخواهید صدایی را کلون کنید، وارد Voice Library شوید. این بخش مجموعهای از صداهای آماده را در اختیار شما قرار میدهد و میتوانید چند گزینه را با متن فارسی پروژه خود آزمایش کنید.
برای پیداکردن صداهای بم، عبارتهایی مانند Deep، Deep Male، Low یا Narrator را جستوجو کنید. سپس جنسیت، سن، زبان، لهجه و دستهبندی را فیلتر کنید.
اشتباهات رایج در کلون کردن صدا
- استفاده از فایلی که موسیقی، افکت یا صدای چند نفر دارد.
- ترکیب فایلهایی که با میکروفنها و کیفیتهای متفاوت ضبط شدهاند.
- انتخاب نمونهای با لحنی متفاوت از خروجی موردنظر.
- بارگذاری فایل طولانی و بیکیفیت فقط برای افزایش مدت نمونه.
- نوشتن متن فارسی بدون نقطه، ویرگول و مکث مناسب.
- کلونکردن صدای دیگران بدون اجازه یا استفاده گمراهکننده از نتیجه.
سؤالات متداول
آیا ElevenLabs از زبان فارسی پشتیبانی میکند؟
بله، مدل Eleven v3 از فارسی پشتیبانی میکند. علائم نگارشی و نوشتن درست واژهها روی طبیعیشدن نتیجه اثر دارند.
برای Instant Voice Cloning چقدر صدا لازم است؟
یک تا دو دقیقه صدای واضح و تمیز برای شروع مناسب است. کیفیت ضبط از طول زیاد فایل مهمتر است.
چرا صدای ساختهشده نویز یا اکو دارد؟
مدل ایرادهای نمونه ورودی را هم یاد میگیرد. فایل بدون موسیقی، نویز، پژواک و صدای گوینده دوم انتخاب کنید.
آیا استفاده از Adobe Podcast اجباری است؟
خیر. اگر فایل اولیه تمیز است، پردازش اضافه لازم نیست. این ابزار فقط برای بهترکردن نمونههای دارای نویز یا پژواک پیشنهاد میشود.
جمعبندی
برای ساخت صدای فارسی طبیعی با ElevenLabs، ابتدا یک نمونه تمیز آماده کنید، روش مناسب کلونکردن را انتخاب کنید و متن فارسی را با علائم نگارشی دقیق بنویسید. اگر به صدای اختصاصی نیاز ندارید، Voice Library راه سریعتری برای پیدا کردن صداهای آماده است. در تمام مراحل، رضایت صاحب صدا و استفاده مسئولانه را جدی بگیرید.
برای استفاده از Voice Cloning، تولید صدای بیشتر و امکانات پولی ElevenLabs میتوانید اشتراک موردنیاز را از معین گیفت تهیه کنید.
