Mistral представила передовые открытые модели распознавания речи Voxtral

15 июля компания Mistral AI громко заявила о себе в сфере технологий: в свет вышло новое семейство моделей распознавания речи — Voxtral. Разработчики уверены, что их детище не просто догоняет конкурентов, а уверенно их обгоняет. И похоже, не без оснований.
Mistral представила передовые открытые модели распознавания речи Voxtral

Новые возможности

Французский стартап Mistral AI официально представил семейство моделей Voxtral — два решения для распознавания речи с открытым исходным кодом. 

Модели представлены в двух вариантах:

  • Voxtral 3B (3 миллиарда параметров) оптимизирована для локальных и краевых вычислений, что подходит для устройств с ограниченными ресурсами.
  • Voxtral 24B (24 миллиарда параметров) предназначена для масштабных производственных задач, таких как обработка больших объемов аудио в корпоративных системах.

Обе модели поддерживают обработку аудио длительностью до 30 минут для транскрипции и до 40 минут для анализа содержания. Также умеют отвечать на вопросы по аудиофайлам, создавать структурированные сводки и вызывать функции на основе голосовых команд, например, запускать API или рабочие процессы.

Модели сейчас доступны пользователям через API, классический веб-чат и куда же без платформы Hugging Face. Они легко интегрируются в самые разные цифровые продукты — от чат-ботов до сложных систем автоматизации в бизнесе и промышленности.

Чем отличается Voxtral от других решений?

Семейство Voxtral — это часть стратегии Mistral AI по созданию доступных и производительных ИИ-инструментов. Как уже упоминалось выше, эти модели обеспечивают:

  • Поддержку длинных аудиофрагментов;
  • Ответы на вопросы по содержанию аудио;
  • Создание сжатых, структурированных сводок;
  • Управление внешними процессами голосом;
  • Высокую точность и универсальность при работе с несколькими языками.

Особенностью младшей модели Voxtral 3B является её эффективность в условиях ограниченных вычислительных ресурсов, таких как мобильные устройства или встраиваемые системы. Старшая модель Voxtral 24B предназначена для масштабных серверных решений — например, автоматической обработки звонков в контакт-центрах или анализа больших объемов записей встреч и переговоров где требуется высокая производительность и точность обработки аудиоконтента.

Сравнение с конкурентами

По словам разработчиков, Voxtral обходит по качеству распознавания такие известные решения, как:

  • Whisper large-v3 от OpenAI — ранее считавшийся эталоном среди открытых моделей;
  • GPT-4o mini Transcribe от OpenAI;
  • Gemini 2.5 Flash от Google;
  • Scribe от ElevenLabs (в тестах на Mozilla Common Voice).

На английском языке, особенно в коротких аудио, Voxtral показывает лучшие результаты. В тестах на многоязычность модель также демонстрирует высокий уровень точности, автоматически определяя язык речи и адаптируясь под его особенности.

Отдельное внимание разработчики уделили стоимости — API-запросы к Voxtral обойдутся от 0,001 доллара за минуту (примерно 9 копеек), что в шесть раз дешевле, чем использование Whisper (около 54 копеек за минуту).

Языковая поддержка и интеграция

Модели Voxtral поддерживают широкий набор языков, включая:

  • английский,
  • испанский,
  • французский,
  • португальский,
  • хинди,
  • немецкий,
  • голландский,
  • итальянский.

Также они умеют автоматически переключаться между языками и сохраняют высокую точность, даже в условиях фонового шума, ускоренной речи или нестандартной дикции с акцентом.

Дополнительной возможностью стало управление внешними процессами — например, вызов API или запуск бизнес-логики по голосовой команде. Это делает Voxtral особенно интересным решением для автоматизации в корпоративной среде.

Как протестировать новые модели?

Воспользоваться Voxtral вы можете уже сейчас:

  1. Через API-интерфейс;
  2. В веб-чате chat.mistral.ai;
  3. Скачав модели на Hugging Face.

Для корпоративных пользователей доступны индивидуальные настройки, среди которых:

  • частное развертывание,
  • адаптация под задачи бизнеса,
  • определение эмоций,
  • распознавание говорящих.

Связаться с командой Mistral AI можно напрямую через сайт компании для получения консультации и демонстрации возможностей.

Дальнейшие планы на развитие

Команда Mistral AI уже работает над следующим этапом развития Voxtral. Среди ожидаемых нововведений:

  • автоматическое разделение аудио по говорящим (спикер-сегментация),
  • разметка аудио с метками слов и времени,
  • распознавание фоновых и несвязанных звуков.

Кстати, 6 августа 2025 года пройдёт открытый вебинар, посвящённый возможностям Voxtral. Мероприятие, организованное совместно с Inworld AI, будет посвящено созданию голосовых агентов и практическим примерам их применения в бизнесе. Зарегистрироваться можно по этой ссылке.

Факт по теме: Компания Mistral AI менее чем за два года с момента основания стала одним из ключевых игроков в сфере ИИ в Европе, успешно конкурируя с такими гигантами, как OpenAI и Google.
05:45
472
Нет комментариев. Ваш будет первым!