MGMoeinGiftPREMIUM DIGITAL STORE ورود / ثبت‌نام
خانهمجلهمعرفی Gemini 3.5 Transcribe؛ مدل جدید گوگل برای تبدیل هوشمند گفتار به متن

معرفی Gemini 3.5 Transcribe؛ مدل جدید گوگل برای تبدیل هوشمند گفتار به متن

معرفی Gemini 3.5 Transcribe؛ مدل جدید گوگل برای تبدیل هوشمند گفتار به متن

گوگل در تاریخ ۲۶ آگوست ۲۰۲۶ از Gemini 3.5 Transcribe رونمایی کرد؛ مدلی تخصصی برای تبدیل زنده و ضبط‌شده گفتار به متن که می‌تواند مکث‌ها و کلمات اضافه را حذف کند، بیش از ۸۵ زبان را به‌طور خودکار تشخیص دهد و صدای چند گوینده را از یکدیگر تفکیک کند.

خلاصه خبر

Gemini 3.5 Transcribe هم‌اکنون برای توسعه‌دهندگان به‌صورت Public Preview در Gemini API و Google AI Studio ارائه شده است. کاربران عادی نیز در اپلیکیشن Gemini روی macOS به زبان انگلیسی و قابلیت Rambler در Gboard روی اندروید در بعضی کشورها و زبان‌ها به آن دسترسی دارند. قابلیت تایپ صوتی آن به‌زودی به فیلدهای متنی Chrome اضافه خواهد شد.

Gemini 3.5 Transcribe چیست؟

Gemini 3.5 Transcribe جدیدترین مدل تخصصی گوگل برای تبدیل گفتار به متن یا Speech-to-Text است. برخلاف ابزارهای قدیمی که معمولاً صدای ورودی را کلمه‌به‌کلمه ثبت می‌کنند، این مدل تلاش می‌کند منظور گوینده، اصلاحات میان جمله و ساختار طبیعی صحبت را درک کند و در نهایت متنی مرتب‌تر و آماده‌تر برای استفاده تحویل دهد.

گوگل این مدل را برای سناریوهایی مانند زیرنویس زنده، دستیارهای صوتی، تبدیل جلسات و تماس‌ها به متن، تحلیل مکالمات و تایپ صوتی هوشمند طراحی کرده است.

مهم‌ترین قابلیت‌های Gemini 3.5 Transcribe

پشتیبانی از بیش از ۸۵ زبان

مدل می‌تواند زبان گفتار را به‌صورت خودکار تشخیص دهد و با لهجه‌ها و گویش‌های مختلف کار کند. همچنین تغییر زبان در میان یک مکالمه یا Code-Switching را تشخیص می‌دهد.

رونویسی هوشمند

کلمات پرکننده مانند «اِمم» و «آه»، تکرارهای اضافی و بخشی از تپق‌ها را حذف می‌کند. اگر گوینده وسط جمله حرف خود را اصلاح کند، مدل می‌تواند نسخه اصلاح‌شده را در متن نهایی قرار دهد.

تفکیک صدای گویندگان

در فایل‌های صوتی از پیش ضبط‌شده، گفتار تا سه گوینده را با برچسب زمانی به افراد مختلف نسبت می‌دهد. پشتیبانی از بیش از سه گوینده فعلاً آزمایشی اعلام شده است.

واژگان سفارشی

توسعه‌دهندگان می‌توانند نام‌ها، اصطلاحات تخصصی، کدها یا شیوه نوشتن کلمات خاص را به مدل معرفی کنند تا دقت رونویسی در حوزه‌های تخصصی افزایش پیدا کند.

زمان‌بندی کلمه‌به‌کلمه

نسخه مخصوص فایل‌های ضبط‌شده می‌تواند زمان دقیق کلمات و گویندگان را ارائه کند؛ قابلیتی کاربردی برای ساخت زیرنویس، جست‌وجوی صوت و تحلیل تماس‌ها.

دو نسخه برای صدای زنده و فایل ضبط‌شده

gemini-3.5-transcribe-live

نسخه زنده از طریق Gemini Live API کار می‌کند و با تأخیر کمتر از یک ثانیه، متن را هم‌زمان با صحبت‌کردن کاربر ارسال می‌کند. این نسخه برای زیرنویس زنده، دستیار صوتی و رابط‌های تعاملی مناسب است.

gemini-3.5-transcribe

نسخه فایل‌های از پیش ضبط‌شده از طریق Interactions API ارائه می‌شود و برای جلسات، تماس‌ها، پادکست‌ها و فایل‌های صوتی همراه با تفکیک گوینده و زمان‌بندی کلمات کاربرد دارد.

دقت Gemini 3.5 Transcribe چقدر است؟

گوگل با استناد به ارزیابی Artificial Analysis اعلام کرده است که میانگین نرخ خطای کلمه یا WER این مدل در حالت زنده حدود ۴ درصد و برای فایل‌های از پیش ضبط‌شده حدود ۲.۶ درصد است.

طبق اعلام گوگل، زمان رسیدن به متن نهایی در مقایسه با مدل قبلی Chirp 3 حدود ۷۰ درصد بهبود پیدا کرده است. البته دقت واقعی همچنان به زبان، کیفیت میکروفن، نویز محیط، سرعت صحبت و نوع واژگان بستگی دارد.

Gemini 3.5 Transcribe کجا در دسترس است؟

  • توسعه‌دهندگان: به‌صورت Public Preview در Gemini API از طریق Google AI Studio و Google Antigravity.
  • سازمان‌ها: به‌صورت Public Preview در Gemini Enterprise Agent Platform.
  • کاربران macOS: در اپلیکیشن Gemini روی مک و فعلاً به زبان انگلیسی.
  • کاربران اندروید: از طریق قابلیت Rambler در Gboard در کشورهای و زبان‌های منتخب.
  • مرورگر Chrome: امکان صحبت برای تایپ در فیلدهای متنی به‌زودی عرضه می‌شود.

آیا Gemini 3.5 Transcribe مخصوص Pixel 11 است؟

خیر؛ گوگل در اطلاعیه رسمی معرفی این مدل، دسترسی را به «Rambler در اندروید و در کشورهای و زبان‌های منتخب» محدود کرده و آن را قابلیت اختصاصی Pixel 11 معرفی نکرده است. بنابراین دسترسی واقعی می‌تواند بر اساس دستگاه، کشور، زبان، نسخه Gboard و زمان انتشار مرحله‌ای متفاوت باشد.

کاربردهای مهم مدل جدید گوگل

  • ساخت زیرنویس زنده برای کلاس، وبینار و پخش اینترنتی
  • تبدیل جلسه‌ها، مصاحبه‌ها و تماس‌های کاری به متن
  • رونویسی پادکست و آماده‌سازی متن برای انتشار در وب‌سایت
  • ساخت دستیارهای صوتی با واکنش سریع
  • تحلیل مرکز تماس و جداسازی صحبت مشتری و اپراتور
  • تایپ صوتی چندزبانه و ویرایش متن با فرمان صوتی
  • تشخیص نام محصولات، کد سفارش و اصطلاحات تخصصی با واژگان سفارشی

محدودیت‌ها و نکات مهم

  • مدل در زمان انتشار به‌صورت Public Preview ارائه شده و ممکن است API یا امکانات آن تغییر کند.
  • پشتیبانی از بیش از سه گوینده هنوز آزمایشی است.
  • رونویسی هوشمند ممکن است بخشی از حالت گفتاری را حذف یا بازنویسی کند؛ برای متن حقوقی یا پزشکی باید خروجی بازبینی شود.
  • دسترسی کاربران عادی به کشور، زبان، دستگاه و انتشار مرحله‌ای قابلیت بستگی دارد.
  • برای فایل‌های حساس، شرایط حریم خصوصی و نحوه پردازش داده در محصول یا API انتخابی باید جداگانه بررسی شود.

سؤالات متداول

آیا Gemini 3.5 Transcribe از زبان فارسی پشتیبانی می‌کند؟

گوگل پشتیبانی خودکار از بیش از ۸۵ زبان و لهجه‌های مختلف را اعلام کرده است. برای اطمینان از کیفیت فارسی در کاربرد تخصصی، بهتر است نمونه صوت واقعی خود را در نسخه آزمایشی بررسی کنید.

آیا مدل کلمات اضافه و تپق‌ها را حذف می‌کند؟

بله، حالت Smart Transcription برای حذف کلمات پرکننده، مدیریت اصلاحات میان جمله و قالب‌بندی خودکار متن طراحی شده است.

چند گوینده را تشخیص می‌دهد؟

برای فایل ضبط‌شده تا سه گوینده به‌صورت رسمی پشتیبانی می‌شود و شناسایی بیش از سه نفر فعلاً آزمایشی است.

آیا در Chrome قابل استفاده است؟

گوگل اعلام کرده قابلیت تایپ صوتی هوشمند در فیلدهای متنی Chrome به‌زودی منتشر می‌شود؛ تاریخ دقیق انتشار عمومی هنوز اعلام نشده است.

جمع‌بندی

Gemini 3.5 Transcribe نشان می‌دهد رقابت مدل‌های صوتی فقط بر سر تبدیل دقیق کلمات نیست؛ بلکه درک منظور، حذف آشفتگی‌های گفتاری، تشخیص چند زبان و تحویل متنی آماده استفاده اهمیت بیشتری پیدا کرده است. عرضه API زنده و نسخه فایل ضبط‌شده نیز این مدل را برای کاربران عادی، توسعه‌دهندگان و کسب‌وکارها به ابزاری قابل‌توجه تبدیل می‌کند.

اشتراک‌گذاری مطلبتلگرام

سؤالات متداول

چطور محصول مناسب خودم را انتخاب کنم؟

در صفحه محصولات، توضیحات و شرایط هر سرویس را بررسی کنید و در صورت نیاز از پشتیبانی کمک بگیرید.

آیا مطالب مجله به‌روز می‌شوند؟

بله؛ مطالب مهم و تغییرات سرویس‌ها به‌صورت دوره‌ای بررسی و به‌روزرسانی می‌شوند.