به گزارش ایده روز آنلاین، به نقل از زومیت، اسپیسایکسایآی اعلام کرد که مدل صوتی Grok Voice Think Fast 2.0 اکنون در صدر Artificial Analysis Speech-to-Speech Index قرار دارد. این شاخص توانایی مدلهای صوتی را در انجام کارهایی فراتر از تبدیل متن به صدا بررسی میکند؛ از جمله اینکه مدل تا چه اندازه میتواند گفتار انسان را درک و درباره آن استدلال کند، در مکالمه طبیعی باقی بماند و وظایف واقعی را با استفاده از ابزارهای نرمافزاری انجام دهد.
Artificial Analysis در نسخه فعلی این شاخص، چهار بخش را با وزن برابر در نظر میگیرد: استدلال صوتی (Big Bench Audio)، عملکرد عاملمحور، ترجیح کاربران در مکالمهی صوتی و موفقیت در انجام وظایف واقعی. در بخش Task Success، برای نمونه، مدل باید در نقش یک عامل پشتیبانی مشتری بتواند با استفاده از ابزارهای مختلف مشکلات کاربران را حل کند و در نهایت به وضعیت صحیح در سیستم برسد.
Grok Voice Think Fast 2.0 در ارزیابی منتشرشده از سوی xAI امتیاز ۷۹ درصد را در شاخص کلی دریافت کرد؛ بالاتر از GPT-Realtime-2.1 High با ۷۳٫۹ درصد و Gemini 3.1 Flash Liveبا ۷۱٫۵ درصد.
تفاوت مهم Think Fast 2.0 با یک دستیار صوتی معمولی این است که مدل صرفاً صدای کاربر را به متن تبدیل نمیکند و سپس پاسخ نمیدهد؛ بلکه میتواند همزمان با صحبتکردن، روی درخواست کاربر استدلال کند و ابزارهای لازم را به کار بگیرد. به گفتهی اسپیسایکسایآی، این رویکرد باعث میشود تماس با عامل صوتی طبیعیتر باشد و برخی فراخوانیهای ابزار حتی پیش از پایان جمله اول کاربر انجام شوند.
۵۸۵۸
Source link
پایگاه خبری ایده روز آنلاین
