Grok научился расшифровывать речь вдвое точнее и за те же деньги

SpaceXAI выпустила Grok Voice Transcribe 2.0, модель для перевода речи в текст. По внутренним тестам компании она вдвое точнее первой версии на телефонных звонках, диктовке номеров и коротких голосовых командах, а стоит столько же. Модель уже доступна в API и понимает русский язык.
Grok научился расшифровывать речь вдвое точнее и за те же деньги

Grok Voice Transcribe — сервис распознавания речи от SpaceXAI, компании Илона Маска, которая выпускает Grok. Он превращает аудио и видео в текст и работает через API, то есть встраивается в чужие продукты, например в колл-центры, видеосервисы и голосовых ассистентов. Вторая версия вышла 18 сентября и сразу доступна разработчикам.

Звонки, акценты и продиктованные адреса

Grok Voice Transcribe 2.0 собрана на той же аудиомодели, что и голосовой режим Grok. По данным SpaceXAI, эта основа уже обслуживает десятки тысяч звонков в поддержку в день, расшифровала миллионы часов закадрового текста в видео и работает в ассистенте Grok в автомобилях Tesla.

Дообучали модель на «грязном» живом звуке. Это телефонная линия с плохим качеством, фоновый шум, акценты, люди, которые говорят одновременно, и самое неудобное для любой расшифровки — продиктованные номера телефонов, адреса почты и короткие команды вроде «включи музыку». Именно на таких сценариях SpaceXAI и замеряла прирост.

Вдвое точнее, но по своим тестам

Компания сравнила версии на четырёх наборах записей из реального трафика. В них вошли звонки в поддержку, разговоры с Grok, диктовка учётных данных и короткие фразы для голосового ассистента. Вторая версия выиграла у первой на всех четырёх, а на телефонии, по словам SpaceXAI, обошла все модели, которые компания тестировала.

Точная цифра в анонсе одна. На коротких фразах на 19 языках доля ошибочно распознанных слов (WER, главный показатель качества расшифровки) упала с 20,6% до 6,8%. Остальные результаты показаны только на графиках, и все четыре набора собраны внутри компании.

Для внешней проверки SpaceXAI ссылается на рейтинг Artificial Analysis, где Grok Voice Transcribe 2.0 заняла первое место по точности среди 32 моделей потоковой расшифровки. В соседней таблице того же рейтинга, где сравнивают расшифровку готовых файлов, картина скромнее. Там у модели 2,3% ошибок и пятое место из 61, впереди модели Alibaba, Microsoft и ElevenLabs с результатом от 1,7% до 2,2%. Если верить заявлению компании, в потоковой расшифровке Grok лидирует, а в обработке записей держится в сильной группе.

Русский в списке из 25 языков

Самый большой прирост SpaceXAI записывает на счёт многоязычности. Grok Voice Transcribe 2.0 сама определяет язык записи и замечает, когда собеседник переходит на другой прямо посреди разговора. Точного числа языков в анонсе нет, но в документации перечислены 25, и русский среди них есть.

Функции Grok Voice Transcribe без доплаты

  • Два режима. Расшифровка готовых файлов и ссылок либо потоковая, в реальном времени.
  • Разметка по спикерам. Модель помечает, какую реплику произнёс какой человек, это входит в базовую цену.
  • Время каждого слова. У каждого слова есть отметки начала и конца, удобно для субтитров и поиска по записи.
  • До восьми каналов. Каждая дорожка расшифровывается отдельно, например оператор и клиент в записи звонка.
  • Словарь терминов. До 100 слов на запрос, которые модель должна узнавать точно, от названий продуктов до медицинской лексики.
  • Чистый текст. Числа, даты, суммы, телефоны и адреса почты приходят в письменном виде, слова-паразиты вроде «эм» убираются.
  • Конец реплики. Для голосовых агентов модель определяет, договорил ли человек, чтобы ассистент не перебивал.

В анонсе обещаны и оценки уверенности для каждого слова, но в примере ответа из документации такого поля пока нет. Тем, кому оно важно, стоит проверить на своих записях.

Loom передаёт расшифровку прямо в Cursor

Первым крупным клиентом SpaceXAI называет Atlassian. Компания перевела на Grok Voice Transcribe 2.0 расшифровку всех видео в Loom, сервисе коротких записей экрана, потому что новая модель оказалась точнее прежнего решения. Сценарий выглядит так. Разработчик надиктовывает в Loom план изменений, расшифровка уходит в редактор кода Cursor , и тот сам правит программу.

«Grok отвечает за распознавание речи в Loom, Cursor превращает его в код, и мы замыкаем цикл от контекста до кода. Записываешь, что имеешь в виду, и работа сделана»,

- говорит Санчан Саксена, старший вице-президент Atlassian.

Час записи за десять центов

Цены остались прежними. Расшифровка готовых файлов стоит 0,10 доллара за час аудио, потоковая 0,20 доллара, разметка спикеров, временные метки и словарь терминов включены. В пересчёте Artificial Analysis это 1,67 доллара за тысячу минут записи.

Модель уже работает в Speech-to-Text API под именем grok-voice-transcribe-2.0. По умолчанию API пока отдаёт первую версию, вторая станет основной «в ближайшее время», а первую отключат в течение нескольких недель. Точных дат SpaceXAI не называет. Кто уже подключён, получит прирост точности без правок в коде, когда смена произойдёт.

Как попробовать Grok Voice Transcribe 2.0

Живую демонстрацию и ключи дают в консоли разработчика console.x.ai. Для проверки второй версии до смены умолчания модель нужно указать в запросе явно. API принимает файлы до 500 МБ в 12 форматах, включая MP3, WAV, OGG, MP4 и M4A. Для оплаты из России, как и с другими зарубежными API, понадобится иностранная карта. Готового приложения для обычного пользователя у сервиса нет, это инструмент для тех, кто встраивает расшифровку в свой продукт или автоматизацию.

Кому Grok Voice Transcribe 2.0 пригодится

Для владельцев сайтов и авторов практический смысл в цене. Расшифровка часового интервью или вебинара обходится в десять центов, и это делает автоматический перевод видео в статьи, субтитры и конспекты почти бесплатным. Прежде чем переводить на Grok поток русскоязычных записей, стоит прогнать пару своих файлов. Громкие цифры SpaceXAI получены в основном на английском, а по русскому отдельных результатов нет.

Сильна там, где звонят и диктуют

В обработке записей Grok Voice Transcribe 2.0 уступает лидерам, зато хорошо закрывает свою нишу. Модель сильна там, где звук плохой, а ошибка в одной цифре телефона обходится дороже всего остального текста. В паре с низкой ценой это серьёзная заявка на колл-центры и голосовых агентов. Проверкой станут ближайшие недели, когда вторая версия станет стандартом для всех клиентов API и её начнут сравнивать на чужих записях.

21:20
29
Нет комментариев. Ваш будет первым!