اسپیس‌ایکس‌ای‌آی اعلام کرد که مدل صوتی Grok Voice Think Fast 2.0 اکنون در صدر Artificial Analysis Speech-to-Speech Index قرار دارد. این شاخص توانایی مدل‌های صوتی را در انجام کارهایی فراتر از تبدیل متن به صدا بررسی می‌کند؛ از جمله اینکه مدل تا چه اندازه می‌تواند گفتار انسان را درک و درباره آن استدلال کند، در مکالمه طبیعی باقی بماند و وظایف واقعی را با استفاده از ابزارهای نرم‌افزاری انجام دهد.

Artificial Analysis در نسخه فعلی این شاخص، چهار بخش را با وزن برابر در نظر می‌گیرد: استدلال صوتی (Big Bench Audio)، عملکرد عامل‌محور، ترجیح کاربران در مکالمه‌ی صوتی و موفقیت در انجام وظایف واقعی. در بخش Task Success، برای نمونه، مدل باید در نقش یک عامل پشتیبانی مشتری بتواند با استفاده از ابزارهای مختلف مشکلات کاربران را حل کند و در نهایت به وضعیت صحیح در سیستم برسد.

SpaceXAI

Grok Voice Think Fast 2.0 در ارزیابی منتشرشده از سوی xAI امتیاز ۷۹ درصد را در شاخص کلی دریافت کرد؛ بالاتر از GPT-Realtime-2.1 High با ۷۳٫۹ درصد و Gemini 3.1 Flash Liveبا ۷۱٫۵ درصد.

تفاوت مهم Think Fast 2.0 با یک دستیار صوتی معمولی این است که مدل صرفاً صدای کاربر را به متن تبدیل نمی‌کند و سپس پاسخ نمی‌دهد؛ بلکه می‌تواند هم‌زمان با صحبت‌کردن، روی درخواست کاربر استدلال کند و ابزارهای لازم را به کار بگیرد. به گفته‌ی اسپیس‌ایکس‌ای‌آی، این رویکرد باعث می‌شود تماس با عامل صوتی طبیعی‌تر باشد و برخی فراخوانی‌های ابزار حتی پیش از پایان جمله اول کاربر انجام شوند.