Голосовой Grok обошёл специализированные модели расшифровки речи на их же поле

xAI выкатила Grok Voice Think Fast 2.0: модель рассуждает параллельно с речью, обогнала OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash и оказалась точнее специализированных моделей расшифровки речи. Ценник — $0,08 за минуту аудио.

Aravana··1 мин

🔴 Голосовой Grok обошёл специализированные модели расшифровки речи на их же поле

xAI выкатила Grok Voice Think Fast 2.0, новую голосовую модель, которая рассуждает над вопросом параллельно с речью, без задержки в разговоре.

По результатам внутренних тестов, модель обошла OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash на большинстве прогонов. Но самое интересное: она оказалась точнее специализированных моделей расшифровки речи, которые годами затачивали ровно под одну задачу: переводить звук в текст. Универсал побил специалистов.

Второй контраст не в тестах, а в живом бизнесе. xAI не стала устраивать красивые демо на сцене, а поставила модель в колл-центр Starlink. A/B-тест зафиксировал заметный рост конверсии в продажи и доли обращений, которые бот закрывает без переключения на живого оператора. Ценник: $0,08 за минуту аудио.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

#нейросети #LLM #Grok #xAI #модели #мультимодальность #ИИ #технологии #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Приватные чаты с Claude всплыли в поиске Google

Диалоги пользователей Claude, которыми делились по «приватной» ссылке, попали в индекс Google и Bing — среди утёкшего медзаписи, внутренние документы и персональные данные.

·1 мин

DeepSeek заморозила раунд при оценке ~$67 млрд из-за пары вирусных постов

DeepSeek сообщила инвесторам о паузе во втором раунде на ~$1,4 млрд при оценке около $67 млрд — спустя недели после первого раунда на $7 млрд и на фоне вирусных постов основателя.

·1 мин

MiniMax научила синтезированный голос запинаться, чтобы его не отличить от живого

Новая TTS-модель MiniMax Speech 2.8 добавляет живые запинки и паузы, клонирует голос с 10 секунд записи и звучит на уровне студийной записи.

·1 мин