گوگل در تاریخ ۲۶ آگوست ۲۰۲۶ از Gemini 3.5 Transcribe رونمایی کرد؛ مدلی تخصصی برای تبدیل زنده و ضبطشده گفتار به متن که میتواند مکثها و کلمات اضافه را حذف کند، بیش از ۸۵ زبان را بهطور خودکار تشخیص دهد و صدای چند گوینده را از یکدیگر تفکیک کند.
Gemini 3.5 Transcribe هماکنون برای توسعهدهندگان بهصورت Public Preview در Gemini API و Google AI Studio ارائه شده است. کاربران عادی نیز در اپلیکیشن Gemini روی macOS به زبان انگلیسی و قابلیت Rambler در Gboard روی اندروید در بعضی کشورها و زبانها به آن دسترسی دارند. قابلیت تایپ صوتی آن بهزودی به فیلدهای متنی Chrome اضافه خواهد شد.
Gemini 3.5 Transcribe چیست؟
Gemini 3.5 Transcribe جدیدترین مدل تخصصی گوگل برای تبدیل گفتار به متن یا Speech-to-Text است. برخلاف ابزارهای قدیمی که معمولاً صدای ورودی را کلمهبهکلمه ثبت میکنند، این مدل تلاش میکند منظور گوینده، اصلاحات میان جمله و ساختار طبیعی صحبت را درک کند و در نهایت متنی مرتبتر و آمادهتر برای استفاده تحویل دهد.
گوگل این مدل را برای سناریوهایی مانند زیرنویس زنده، دستیارهای صوتی، تبدیل جلسات و تماسها به متن، تحلیل مکالمات و تایپ صوتی هوشمند طراحی کرده است.
مهمترین قابلیتهای Gemini 3.5 Transcribe
پشتیبانی از بیش از ۸۵ زبان
مدل میتواند زبان گفتار را بهصورت خودکار تشخیص دهد و با لهجهها و گویشهای مختلف کار کند. همچنین تغییر زبان در میان یک مکالمه یا Code-Switching را تشخیص میدهد.
رونویسی هوشمند
کلمات پرکننده مانند «اِمم» و «آه»، تکرارهای اضافی و بخشی از تپقها را حذف میکند. اگر گوینده وسط جمله حرف خود را اصلاح کند، مدل میتواند نسخه اصلاحشده را در متن نهایی قرار دهد.
تفکیک صدای گویندگان
در فایلهای صوتی از پیش ضبطشده، گفتار تا سه گوینده را با برچسب زمانی به افراد مختلف نسبت میدهد. پشتیبانی از بیش از سه گوینده فعلاً آزمایشی اعلام شده است.
واژگان سفارشی
توسعهدهندگان میتوانند نامها، اصطلاحات تخصصی، کدها یا شیوه نوشتن کلمات خاص را به مدل معرفی کنند تا دقت رونویسی در حوزههای تخصصی افزایش پیدا کند.
زمانبندی کلمهبهکلمه
نسخه مخصوص فایلهای ضبطشده میتواند زمان دقیق کلمات و گویندگان را ارائه کند؛ قابلیتی کاربردی برای ساخت زیرنویس، جستوجوی صوت و تحلیل تماسها.
دو نسخه برای صدای زنده و فایل ضبطشده
نسخه زنده از طریق Gemini Live API کار میکند و با تأخیر کمتر از یک ثانیه، متن را همزمان با صحبتکردن کاربر ارسال میکند. این نسخه برای زیرنویس زنده، دستیار صوتی و رابطهای تعاملی مناسب است.
نسخه فایلهای از پیش ضبطشده از طریق Interactions API ارائه میشود و برای جلسات، تماسها، پادکستها و فایلهای صوتی همراه با تفکیک گوینده و زمانبندی کلمات کاربرد دارد.
دقت Gemini 3.5 Transcribe چقدر است؟
گوگل با استناد به ارزیابی Artificial Analysis اعلام کرده است که میانگین نرخ خطای کلمه یا WER این مدل در حالت زنده حدود ۴ درصد و برای فایلهای از پیش ضبطشده حدود ۲.۶ درصد است.
طبق اعلام گوگل، زمان رسیدن به متن نهایی در مقایسه با مدل قبلی Chirp 3 حدود ۷۰ درصد بهبود پیدا کرده است. البته دقت واقعی همچنان به زبان، کیفیت میکروفن، نویز محیط، سرعت صحبت و نوع واژگان بستگی دارد.
Gemini 3.5 Transcribe کجا در دسترس است؟
- توسعهدهندگان: بهصورت Public Preview در Gemini API از طریق Google AI Studio و Google Antigravity.
- سازمانها: بهصورت Public Preview در Gemini Enterprise Agent Platform.
- کاربران macOS: در اپلیکیشن Gemini روی مک و فعلاً به زبان انگلیسی.
- کاربران اندروید: از طریق قابلیت Rambler در Gboard در کشورهای و زبانهای منتخب.
- مرورگر Chrome: امکان صحبت برای تایپ در فیلدهای متنی بهزودی عرضه میشود.
آیا Gemini 3.5 Transcribe مخصوص Pixel 11 است؟
خیر؛ گوگل در اطلاعیه رسمی معرفی این مدل، دسترسی را به «Rambler در اندروید و در کشورهای و زبانهای منتخب» محدود کرده و آن را قابلیت اختصاصی Pixel 11 معرفی نکرده است. بنابراین دسترسی واقعی میتواند بر اساس دستگاه، کشور، زبان، نسخه Gboard و زمان انتشار مرحلهای متفاوت باشد.
کاربردهای مهم مدل جدید گوگل
- ساخت زیرنویس زنده برای کلاس، وبینار و پخش اینترنتی
- تبدیل جلسهها، مصاحبهها و تماسهای کاری به متن
- رونویسی پادکست و آمادهسازی متن برای انتشار در وبسایت
- ساخت دستیارهای صوتی با واکنش سریع
- تحلیل مرکز تماس و جداسازی صحبت مشتری و اپراتور
- تایپ صوتی چندزبانه و ویرایش متن با فرمان صوتی
- تشخیص نام محصولات، کد سفارش و اصطلاحات تخصصی با واژگان سفارشی
محدودیتها و نکات مهم
- مدل در زمان انتشار بهصورت Public Preview ارائه شده و ممکن است API یا امکانات آن تغییر کند.
- پشتیبانی از بیش از سه گوینده هنوز آزمایشی است.
- رونویسی هوشمند ممکن است بخشی از حالت گفتاری را حذف یا بازنویسی کند؛ برای متن حقوقی یا پزشکی باید خروجی بازبینی شود.
- دسترسی کاربران عادی به کشور، زبان، دستگاه و انتشار مرحلهای قابلیت بستگی دارد.
- برای فایلهای حساس، شرایط حریم خصوصی و نحوه پردازش داده در محصول یا API انتخابی باید جداگانه بررسی شود.
سؤالات متداول
آیا Gemini 3.5 Transcribe از زبان فارسی پشتیبانی میکند؟
گوگل پشتیبانی خودکار از بیش از ۸۵ زبان و لهجههای مختلف را اعلام کرده است. برای اطمینان از کیفیت فارسی در کاربرد تخصصی، بهتر است نمونه صوت واقعی خود را در نسخه آزمایشی بررسی کنید.
آیا مدل کلمات اضافه و تپقها را حذف میکند؟
بله، حالت Smart Transcription برای حذف کلمات پرکننده، مدیریت اصلاحات میان جمله و قالببندی خودکار متن طراحی شده است.
چند گوینده را تشخیص میدهد؟
برای فایل ضبطشده تا سه گوینده بهصورت رسمی پشتیبانی میشود و شناسایی بیش از سه نفر فعلاً آزمایشی است.
آیا در Chrome قابل استفاده است؟
گوگل اعلام کرده قابلیت تایپ صوتی هوشمند در فیلدهای متنی Chrome بهزودی منتشر میشود؛ تاریخ دقیق انتشار عمومی هنوز اعلام نشده است.
جمعبندی
Gemini 3.5 Transcribe نشان میدهد رقابت مدلهای صوتی فقط بر سر تبدیل دقیق کلمات نیست؛ بلکه درک منظور، حذف آشفتگیهای گفتاری، تشخیص چند زبان و تحویل متنی آماده استفاده اهمیت بیشتری پیدا کرده است. عرضه API زنده و نسخه فایل ضبطشده نیز این مدل را برای کاربران عادی، توسعهدهندگان و کسبوکارها به ابزاری قابلتوجه تبدیل میکند.
