فناوری تولید گفتار مصنوعی از مرحله‌ی خوانش خشک متون فراتر رفته و وارد دورانی شده که در آن هوش مصنوعی توانایی ایفای نقش و صداسازی پویا را پیدا کرده است. گوگل در همین راستا با معرفی دو عضو جدید از خانواده‌ی مدل‌های زبانی خود، بستری فراهم آورده است که سیستم تولید صوت را به یک استودیو خلاقانه و تعاملی بدل می‌سازد.

دو مدل Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS به‌منظور پاسخ‌گویی به نیازهای پیشرفته‌ی بازی‌سازان، پادکسترها و توسعه‌دهندگان تجاری عرضه شده‌اند. رونمایی از مدل‌های یادشده پس از توسعه‌ی فناوری‌هایی چون Gemini 3.5 Live Translate و Gemini 3.8 Live گامی کلیدی در تکمیل سبد محصولات صوتی گوگل به‌شمار می‌رود.

مدل Gemini 3.8 Flash TTS برای هدایت دقیق دیالوگ‌ها و خلق صداهای منحصر‌به‌فرد از پایه طراحی شده است. کاربران می‌توانند با تکیه بر پرامپت‌های متنی ساده، لحن، لهجه و ویژگی‌های شخصیتی متعددی را در بیش از ۱۰۰ زبان زنده و گویش گوناگون ایجاد کنند. کنترل جزئیاتی نظیر مکث‌ها، تغییر ناگهانی لحن و صداهای غیرکلامی مانند خنده، نفس‌نفس زدن یا تصدیق‌های کلامی سبب شده است خروجی نهایی شباهت فراوانی به اجرای یک بازیگر واقعی پیدا کند.

جدول مقایسه کیفیت مدل‌های هوش مصنوعی Gemini 3.8 Flash TTS و سایر مدل‌ها
جدول مقایسه عملکرد مدل Gemini 3.8 Flash TTS در معیارهای مختلف صوتی
جدول مقایسه عملکرد مدل‌های Gemini 3.8 Flash TTS و سایر هوش مصنوعی‌ها در زبان‌های مختلف

برخی از برجسته‌ترین ویژگی‌ها شامل موارد زیر هستند:

  • طراحی مولد صدا: امکان ایجاد صداهای بدیع برای کاراکترهای فانتزی یا راویان داستان با فرمان‌های متنی ساده.
  • آرشیو گسترده: دسترسی به بیش از ۲٬۰۰۰ صدای بهینه‌سازی‌شده برای تولید محتوا با پشتیبانی از لهجه‌های بومی مثل اسپانیایی مکزیکی و فرانسوی کبکی.
  • تنظیم و بازترکیب: قابلیت دستکاری زیروبمی صدا، سرعت بیان و چگالی لهجه در نسخه‌های آتی.
  • اجرای هم‌زمان دو گوینده: مدیریت مکالمات چندنفره از روی یک متن واحد بدون تداخل صدایی.

توسعه‌دهندگان در مدل جدید توانایی بازآفرینی پروفایل‌های صوتی را تنها با دریافت یک فایل صوتی ۳۰ ثانیه‌ای به‌دست آورده‌اند. حفظ اصالت و جلوگیری از سوءاستفاده‌های احتمالی دغدغه‌ی اصلی مهندسان در پیاده‌سازی چنین امکانی بوده است. سیستم شبیه‌سازی برای جلوگیری از جعل هویت، به تأیید کلامی رضایت صاحب صدا پیش از آغاز فرایند متکی خواهد بود.

تمامی قطعات صوتی تولیدشده توسط مدل‌های جدید به‌صورت نامحسوس با فناوری واترمارک SynthID نشانه‌گذاری می‌شوند تا شناور بودن محتوا در بستر استانداردهای C2PA قابل ردیابی باشد. اعمال این تدابیر شفافیت محتوای تولیدی را تضمین کرده است و مانع از انتشار اطلاعات نادرست در بسترهای عمومی خواهد شد.

مدل Gemini 3.8 Flash TTS در آزمون‌های تخصصی Hume AI با کسب امتیاز ۷۱٫۴ در جایگاه نخست شاخص طراحی صدا قرار گرفت و در بخش مدل‌سازی لهجه‌ها امتیاز ۶۰٫۸ را به‌ثبت رساند. در ارزیابی جامع کیفیت، دو مدل جدید گوگل رتبه‌های اول و دوم جدول را تصاحب کردند که نشان‌دهنده‌ی برتری محسوس آن‌ها در تولید صوت طولانی‌مدت در مقایسه با Gemini 3.1 Flash TTS خواهد بود.

مدل اقتصادی‌تر یعنی Gemini 3.8 Flash-Lite TTS برای پروژه‌های با حجم بالا مانند دوبله‌ی خودکار و دستیارهای هوشمند پرسرعت بهینه‌سازی شده است. پلتفرم‌های محبوبی نظیر Vercel و LiveKit و HeyGen و Figma ادغام این مدل‌ها را در ساختار ابزارهای خود آغاز کرده‌اند تا تولید محتوای صوتی چندزبانه را برای کاربرانشان سریع‌تر از گذشته پیش ببرند.

امکانات جدید هم‌اکنون در محیط آزمایشی Google AI Studio و از طریق رابط‌های برنامه‌نویسی اختصاصی در دسترس قرار دارند. کاربران سرویس‌های داخلی گوگل نیز می‌توانند از مدل‌های یادشده در Gemini Notebook و سرویس تولید ویدیوی Google Vids بهره‌مند شوند.