اسپیس‌ایکس‌ای‌آی مدل تبدیل گفتار به متن Voice Transcribe 2.0 را معرفی کرد؛ ابزاری که بدون افزایش قیمت، دقتی دو برابر نسل قبلی خود ارائه می‌دهد. اسپیس‌ایکس‌ای‌آی می‌گوید، نسخه‌ی جدید میان ۳۲ مدل استریمینگ در لیدربورد عمومی Artificial Analysis رتبه‌ی نخست را در زمینه‌ی دقت کسب کرده است.

Voice Transcribe 2.0 بر پایه‌ی مدل صوتی گراک توسعه یافته که در حال حاضر روزانه ده‌ها هزار تماس پشتیبانی مشتریان و میلیون‌ها ساعت روایت ویدئویی را پردازش می‌کند. دستیارهای صوتی گراک در محصولات فیزیکی نظیر خودروهای تسلا نیز از همین ساختار بهره می‌برند.

SpacexAI

مدل Voice Transcribe 2.0 در شرایط واقعی مانند اتصالات ضعیف تلفنی، حضور چند گوینده، لهجه‌های محلی و اطلاعات هویتی گفتاری بهبودهای فراوانی نشان می‌دهد. توسعه‌دهندگان عملکرد سیستم را در مقایسه با هفت رقیب در چهار بخش شامل تماس‌های تلفنی پشتیبانی، مکالمات با گراک، اطلاعات حساس هویتی و دستورهای کوتاه صوتی چندزبانه سنجیده‌اند.

SpacexAI

در آزمون‌های تلفنی با صدای ۸ کیلوهرتز، نرخ خطای کلمات از ۱۰٫۶ درصد در نسخه‌ی پیشین به ۷٫۱ درصد کاهش یافت. نرخ خطای مکالمات نیز از ۸٫۷ درصد به ۳٫۳ درصد رسید و خطای ثبت شماره‌تماس و نشانی‌های ایمیل تا ۳٫۲ درصد پایین آمد.

سیستم بیش از ده‌ها زبان را همراه با تشخیص خودکار و تغییر زبان حین ضبط پشتیبانی می‌کند؛ طوری که خطای عبارت‌های کوتاه در ۱۹ زبان از ۲۰٫۶ درصد به ۶٫۸ درصد کاهش یافته است.

SpacexAI

تعرفه‌ی خدمات بدون تغییر مانده و هزینه‌ی رونویسی دسته‌ای ۰٫۱۰ دلار به ازای هر ساعت صوت و پخش زنده ۰٫۲۰ دلار تعیین شده است. امکاناتی نظیر تفکیک گویندگان، برچسب زمانی برای تک‌تک واژه‌ها و سوگیری اصطلاحات کلیدی بدون هزینه‌ی اضافی ارائه می‌شوند. Voice Transcribe 2.0 طی هفته‌های آینده به مدل پیش‌فرض در Speech-to-Text API تبدیل خواهد شد.