ساخت ویدیوی هوش مصنوعی دیگر فقط به کیفیت تصویر و حرکت دوربین محدود نیست. مدلهای جدید میتوانند همزمان با تصویر، دیالوگ، صدای محیط و موسیقی تولید کنند؛ اما وقتی پای صحبتکردن به زبان فارسی وسط باشد، کیفیت خروجی مدلها یکسان نیست.
در این تست تجربی، پنج مدل ویدیوساز از نظر تلفظ کلمات فارسی، طبیعیبودن صدا، لحن، هماهنگی لبها و پایداری دیالوگ مقایسه شدند. نتیجه نهایی نشان داد Omni Flash در این سناریوی مشخص بهترین عملکرد را داشته و پس از آن Grok، FLUX، H3 و Veo قرار گرفتهاند.
رتبهبندی هوش مصنوعیهای ویدیوساز در فارسیگویی
| رتبه | مدل | جمعبندی نتیجه این تست |
|---|---|---|
| ۱ | Omni Flash | بهترین ترکیب تلفظ، پیوستگی جمله و طبیعیبودن صدای فارسی |
| ۲ | Grok | خروجی قابلقبول و نزدیک به گفتار طبیعی، با احتمال نوسان در برخی واژهها |
| ۳ | FLUX | صدای همگام مناسب، اما نتیجه فارسی در این آزمایش پایینتر از دو رتبه اول |
| ۴ | H3 | توانایی تولید دیالوگ فارسی، با ضعف بیشتر در تلفظ یا طبیعیبودن نسبت به رتبههای بالاتر |
| ۵ | Veo | کیفیت تصویری قدرتمند، اما ضعیفترین نتیجه فارسیگویی در همین تست |
نام مدلها در جدول مطابق عنوانهای استفادهشده در تست نوشته شدهاند. برای یک مقایسه فنی قابل تکرار، بهتر است نسخه دقیق مدل نیز ثبت شود؛ برای مثال Grok Imagine Video 1.5، FLUX 3، MiniMax H3 یا Veo 3.1. بعضی پلتفرمها نام نمایشی متفاوتی برای مدل یا گردشکار خود استفاده میکنند.
این مدلها بر چه اساسی مقایسه شدند؟
فقط شنیدن چند واژه فارسی برای ارزیابی کافی نیست. یک مدل ممکن است واژهها را درست بگوید، اما ریتم جمله غیرطبیعی یا حرکت لبها ناهماهنگ باشد. برای این تست، پنج معیار اصلی اهمیت دارند:
۱. صحت تلفظ فارسی
مدل باید حروف و ترکیبهای دشوار فارسی را درست ادا کند و کلمات را به لهجه عربی، انگلیسی یا نامرتبط تبدیل نکند. نام برندها، اعداد، نیمفاصلهها و جملههای ترکیبی فارسی و انگلیسی معمولاً چالش بیشتری ایجاد میکنند.
۲. طبیعیبودن صدا
صدا نباید رباتیک، بریده یا بدون احساس باشد. مکثها، بالا و پایینشدن لحن و سرعت بیان باید با موقعیت صحنه هماهنگ باشند.
۳. هماهنگی لب با دیالوگ
حرکت لبها باید با زمان و آهنگ جمله فارسی هماهنگ باشد. ممکن است صدای یک مدل مناسب باشد، اما دهان شخصیت دیرتر یا سریعتر از صدا حرکت کند.
۴. پایداری دیالوگ
مدل نباید بخشی از جمله را حذف، تکرار یا به عبارت دیگری تبدیل کند. در کلیپهای کوتاه، حتی حذف یک کلمه میتواند پیام تبلیغاتی را خراب کند.
۵. کیفیت کلی ویدیو
چهره، دستها، حرکت دوربین، نور، ثبات شخصیت و نبود اعوجاج نیز بررسی میشوند. بااینحال، رتبه این مقاله مشخصاً روی فارسیگویی تمرکز دارد؛ بنابراین بهترین مدل صوتی لزوماً بهترین مدل تصویری برای تمام پروژهها نیست.
بررسی عملکرد هر مدل در فارسیگویی
رتبه اول: Omni Flash
Omni Flash در این تست بهترین نتیجه را برای صحبتکردن فارسی ارائه کرد. جمله پیوستگی بهتری داشت، ادای واژهها قابلفهمتر بود و صدا نسبت به سایر گزینهها طبیعیتر شنیده شد. هماهنگی میان تصویر، دیالوگ و جریان صحنه نیز باعث شد خروجی آمادهتری برای محتوای تبلیغاتی فارسی ایجاد شود.
طبق توضیحات پلتفرم Higgsfield، Gemini Omni Flash میتواند متن، تصویر، صدا و ویدیو را در یک گردشکار چندرسانهای دریافت کند. همین قابلیت برای پروژههایی که به مرجع شخصیت، لوکیشن و دیالوگ نیاز دارند مفید است. بااینحال، نتیجه خوب یک اجرا تضمین نمیکند که تمام جملههای فارسی در دفعات بعد نیز بدون خطا تولید شوند.
رتبه دوم: Grok
Grok در جایگاه دوم قرار گرفت و توانست دیالوگ فارسی قابلفهم و نسبتاً طبیعی بسازد. مستندات فعلی xAI برای مدلهای ویدیویی Grok از تولید ویدیو، صدا و صداهای ازپیشتعریفشده پشتیبانی میکنند. در نسخههای جدید امکان استفاده از تصویر مرجع و راهنمای صوتی نیز وجود دارد.
برای دریافت نتیجه بهتر، جمله فارسی باید کوتاه، واضح و در علامت نقلقول نوشته شود. ترکیب چند گوینده، دیالوگ طولانی و کلمات انگلیسی میان جمله ممکن است احتمال خطا را افزایش دهد.
رتبه سوم: FLUX
FLUX در این آزمایش رتبه سوم را به دست آورد. FLUX 3 برخلاف نسلهای تصویری قدیمیتر این خانواده، از تولید ویدیو با صدای همگام پشتیبانی میکند و میتواند دیالوگ، صدای محیط، افکت و موسیقی را در پرامپت دریافت کند.
خروجی فارسی آن در این تست قابل استفاده بود، اما از نظر تلفظ یا حس طبیعی به دو گزینه اول نرسید. برای پروژه واقعی بهتر است چند خروجی از یک پرامپت گرفته و بهترین برداشت انتخاب شود.
رتبه چهارم: H3
H3 در این رتبهبندی چهارم شد. MiniMax H3 بهعنوان مدلی با صدای بومی و ورودی چندرسانهای معرفی شده و میتواند تصویر، کلیپ و صوت مرجع را در یک درخواست ترکیب کند. چنین ساختاری برای ساخت صحنههای گفتگو و کنترل بیشتر روی صدا مناسب است.
بااینحال، توانایی تولید صدای بومی به معنی تلفظ بینقص تمام زبانها نیست. نتیجه فارسی در این تست نسبت به Omni Flash، Grok و FLUX ضعف بیشتری داشت و به بازتولید یا اصلاح پس از تولید نیاز پیدا میکرد.
رتبه پنجم: Veo
Veo در همین آزمایش از نظر فارسیگویی آخر شد؛ نه به این معنی که مدل ضعیفی برای ساخت ویدیو است. Veo 3.1 یکی از مدلهای قدرتمند تولید ویدیو با صدای بومی است و از دیالوگ، افکت صوتی و صدای محیط پشتیبانی میکند، اما در جمله فارسی این تست تلفظ یا طبیعیبودن صدا به سطح چهار مدل دیگر نرسید.
اگر اولویت اصلی شما حرکت سینمایی، کیفیت تصویر یا ترکیب صدا و صحنه باشد، Veo همچنان میتواند گزینه مهمی باشد. اما برای دیالوگ فارسی حساس، باید خروجی را قبل از تحویل نهایی با دقت بررسی کنید.
چرا این رتبهبندی ممکن است در تست بعدی تغییر کند؟
- مدلهای ویدیویی مرتب بهروزرسانی میشوند.
- یک مدل ممکن است از طریق چند پلتفرم با تنظیمات متفاوت عرضه شود.
- Seed یا نمونهگیری تصادفی باعث تفاوت میان دو اجرای یکسان میشود.
- مدت ویدیو و تعداد کلمات روی کاملگفتن جمله اثر دارند.
- نشانهگذاری و شیوه نوشتن اعداد میتواند تلفظ را تغییر دهد.
- لهجه درخواستی، جنس صدا و فضای صوتی روی برداشت نهایی اثر میگذارند.
- تصویر مرجع و زاویه چهره روی کیفیت Lip Sync تأثیر دارند.
به همین دلیل، برای انتخاب مدل تجاری بهتر است هر مدل حداقل سه بار با یک پرامپت، یک نسبت تصویر، یک مدت و یک دیالوگ ثابت آزمایش شود.
پرامپت استاندارد برای تست فارسیگویی
برای مقایسه منصفانه میتوانید پرامپت زیر را بدون تغییر در تمام مدلها اجرا کنید:
برای بررسی سختتر میتوانید در آزمایش دوم جملهای شامل عدد، نام انگلیسی و واژههای دشوار اضافه کنید؛ اما مقایسه اصلی را با یک جمله ساده شروع کنید تا علت خطا مشخص باشد.
چطور تلفظ فارسی ویدیوسازها را بهتر کنیم؟
دیالوگ را با خط فارسی بنویسید
نوشتن فارسی با حروف لاتین یا فینگلیش میتواند مدل را به تلفظ انگلیسی سوق دهد. متن نهایی را با حروف فارسی، فاصلهگذاری و نشانهگذاری درست وارد کنید.
جمله را کوتاه نگه دارید
برای کلیپ ۵ تا ۱۰ ثانیهای از جمله بلند استفاده نکنید. بهتر است هر صحنه فقط یک جمله کوتاه داشته باشد و بخشهای بعدی در شاتهای جدا تولید شوند.
لهجه را دقیق مشخص کنید
عبارتهایی مانند «فارسی معیار ایرانی»، «لحن طبیعی تهرانی» یا «بدون لهجه عربی و دری» میتوانند هدف را روشنتر کنند. از دستورهای متناقض مانند «رسمی، کاملاً خودمانی و هیجانزده اما آرام» خودداری کنید.
دیالوگ را از توضیح صحنه جدا کنید
ابتدا شخصیت، دوربین و محیط را توضیح دهید؛ سپس جمله دقیق را در علامت نقلقول قرار دهید. در پایان قواعد صدا و Lip Sync را بنویسید.
نام برند را آوانویسی کنید
اگر مدل نام انگلیسی را اشتباه میگوید، تلفظ موردنظر را داخل پرانتز با خط فارسی بنویسید. بهتر است همزمان چند شکل متفاوت نام را در یک پرامپت قرار ندهید.
چند برداشت تولید کنید
خروجی ویدیوهای مولد تصادفی است. سه برداشت از یک پرامپت بگیرید و فقط براساس بهترین یا بدترین نمونه قضاوت نکنید. برای تست حرفهای، میانگین عملکرد چند خروجی اهمیت بیشتری دارد.
اگر دیالوگ فارسی کاملاً دقیق لازم داریم چه کنیم؟
برای تبلیغی که هر واژه آن باید دقیق باشد، اتکا به صدای بومی ویدیوساز همیشه مطمئنترین روش نیست. یک گردشکار کنترلشدهتر میتواند شامل این مراحل باشد:
- ابتدا تصویر یا ویدیوی بدون دیالوگ را با مدل مناسب تولید کنید.
- صدای فارسی را با گوینده واقعی یا یک ابزار تخصصی تبدیل متن به گفتار بسازید.
- با ابزار Lip Sync حرکت لب را روی صدای نهایی هماهنگ کنید.
- زیرنویس فارسی و صدای محیط را در تدوین اضافه کنید.
- تلفظ نام برند، قیمت، شماره و فراخوان اقدام را دستی کنترل کنید.
این روش یک مرحله بیشتر دارد، اما برای تبلیغات، آموزش و ویدیوی سازمانی کنترل بسیار بیشتری روی جمله نهایی فراهم میکند.
بهترین مدل برای چه کاری است؟
| اولویت پروژه | انتخاب پیشنهادی براساس این تست | نکته اجرایی |
|---|---|---|
| دیالوگ فارسی طبیعی | Omni Flash | حداقل سه خروجی بگیرید |
| گزینه جایگزین فارسی | Grok | جمله کوتاه و یک گوینده |
| صدای همگام و کنترل صحنه | FLUX یا H3 | تلفظ فارسی را جداگانه ارزیابی کنید |
| کیفیت سینمایی با صدای بومی | Veo | برای دیالوگ حساس، دوبله و Lip Sync را در نظر بگیرید |
سؤالات متداول
کدام هوش مصنوعی در این تست فارسی را بهتر صحبت کرد؟
Omni Flash رتبه اول را گرفت و پس از آن Grok، FLUX، H3 و Veo قرار گرفتند. این نتیجه مربوط به سناریو و تنظیمات همین تست است.
آیا Veo از زبان فارسی پشتیبانی نمیکند؟
رتبه پنجم به معنی نبود کامل قابلیت فارسی نیست. Veo ویدیو با صدای بومی تولید میکند، اما فارسیگویی آن در این آزمایش نسبت به چهار گزینه دیگر ضعیفتر بود.
آیا FLUX فقط مدل تولید تصویر نیست؟
نسلهای پیشین FLUX بیشتر با تولید تصویر شناخته میشدند، اما FLUX 3 دارای بخش تولید ویدیو با صدای همگام است. برای جلوگیری از ابهام، در انتشار نتیجه تست باید نسخه دقیق FLUX نوشته شود.
چرا اجرای دوباره همان پرامپت نتیجه متفاوتی میدهد؟
مدلهای مولد از نمونهگیری احتمالاتی استفاده میکنند؛ بنابراین صدا، چهره، حرکت و تلفظ ممکن است در هر اجرا کمی متفاوت باشند.
برای تبلیغ فارسی از صدای خود مدل استفاده کنیم یا دوبله جدا؟
برای محتوای سریع شبکههای اجتماعی، صدای بومی مدل میتواند کافی باشد. برای تبلیغ رسمی، نام برند، قیمت یا متن حقوقی بهتر است صدای نهایی جداگانه کنترل و سپس Lip Sync شود.
جمعبندی
در تست فارسیگویی انجامشده، Omni Flash بهترین خروجی را ارائه کرد و Grok در رتبه دوم قرار گرفت. FLUX، H3 و Veo نیز قادر به تولید ویدیوی دارای صدا هستند، اما در این سناریو از نظر تلفظ و طبیعیبودن فارسی پایینتر قرار گرفتند.
برای انتخاب نهایی فقط به یک خروجی تکی اعتماد نکنید. یک متن ثابت بنویسید، مدل و نسخه دقیق را ثبت کنید، از هر گزینه چند برداشت بگیرید و تلفظ، لحن، Lip Sync و کیفیت تصویر را جداگانه امتیاز دهید. اگر متن باید بدون حتی یک اشتباه خوانده شود، تولید تصویر و صدا را از هم جدا کنید و از دوبله کنترلشده همراه با Lip Sync استفاده کنید.
