Mistral представила передовые открытые модели распознавания речи Voxtral

Новые возможности
Французский стартап Mistral AI официально представил семейство моделей Voxtral — два решения для распознавания речи с открытым исходным кодом.
Модели представлены в двух вариантах:
- Voxtral 3B (3 миллиарда параметров) оптимизирована для локальных и краевых вычислений, что подходит для устройств с ограниченными ресурсами.
- Voxtral 24B (24 миллиарда параметров) предназначена для масштабных производственных задач, таких как обработка больших объемов аудио в корпоративных системах.
Обе модели поддерживают обработку аудио длительностью до 30 минут для транскрипции и до 40 минут для анализа содержания. Также умеют отвечать на вопросы по аудиофайлам, создавать структурированные сводки и вызывать функции на основе голосовых команд, например, запускать API или рабочие процессы.
Модели сейчас доступны пользователям через API, классический веб-чат и куда же без платформы Hugging Face. Они легко интегрируются в самые разные цифровые продукты — от чат-ботов до сложных систем автоматизации в бизнесе и промышленности.
Чем отличается Voxtral от других решений?
Семейство Voxtral — это часть стратегии Mistral AI по созданию доступных и производительных ИИ-инструментов. Как уже упоминалось выше, эти модели обеспечивают:
- Поддержку длинных аудиофрагментов;
- Ответы на вопросы по содержанию аудио;
- Создание сжатых, структурированных сводок;
- Управление внешними процессами голосом;
- Высокую точность и универсальность при работе с несколькими языками.
Особенностью младшей модели Voxtral 3B является её эффективность в условиях ограниченных вычислительных ресурсов, таких как мобильные устройства или встраиваемые системы. Старшая модель Voxtral 24B предназначена для масштабных серверных решений — например, автоматической обработки звонков в контакт-центрах или анализа больших объемов записей встреч и переговоров где требуется высокая производительность и точность обработки аудиоконтента.
Сравнение с конкурентами
По словам разработчиков, Voxtral обходит по качеству распознавания такие известные решения, как:
- Whisper large-v3 от OpenAI — ранее считавшийся эталоном среди открытых моделей;
- GPT-4o mini Transcribe от OpenAI;
- Gemini 2.5 Flash от Google;
- Scribe от ElevenLabs (в тестах на Mozilla Common Voice).
На английском языке, особенно в коротких аудио, Voxtral показывает лучшие результаты. В тестах на многоязычность модель также демонстрирует высокий уровень точности, автоматически определяя язык речи и адаптируясь под его особенности.
Отдельное внимание разработчики уделили стоимости — API-запросы к Voxtral обойдутся от 0,001 доллара за минуту (примерно 9 копеек), что в шесть раз дешевле, чем использование Whisper (около 54 копеек за минуту).
Языковая поддержка и интеграция
Модели Voxtral поддерживают широкий набор языков, включая:
- английский,
- испанский,
- французский,
- португальский,
- хинди,
- немецкий,
- голландский,
- итальянский.
Также они умеют автоматически переключаться между языками и сохраняют высокую точность, даже в условиях фонового шума, ускоренной речи или нестандартной дикции с акцентом.
Дополнительной возможностью стало управление внешними процессами — например, вызов API или запуск бизнес-логики по голосовой команде. Это делает Voxtral особенно интересным решением для автоматизации в корпоративной среде.
Как протестировать новые модели?
Воспользоваться Voxtral вы можете уже сейчас:
- Через API-интерфейс;
- В веб-чате chat.mistral.ai;
- Скачав модели на Hugging Face.
Для корпоративных пользователей доступны индивидуальные настройки, среди которых:
- частное развертывание,
- адаптация под задачи бизнеса,
- определение эмоций,
- распознавание говорящих.
Связаться с командой Mistral AI можно напрямую через сайт компании для получения консультации и демонстрации возможностей.
Дальнейшие планы на развитие
Команда Mistral AI уже работает над следующим этапом развития Voxtral. Среди ожидаемых нововведений:
- автоматическое разделение аудио по говорящим (спикер-сегментация),
- разметка аудио с метками слов и времени,
- распознавание фоновых и несвязанных звуков.
Кстати, 6 августа 2025 года пройдёт открытый вебинар, посвящённый возможностям Voxtral. Мероприятие, организованное совместно с Inworld AI, будет посвящено созданию голосовых агентов и практическим примерам их применения в бизнесе. Зарегистрироваться можно по этой ссылке.
Факт по теме: Компания Mistral AI менее чем за два года с момента основания стала одним из ключевых игроков в сфере ИИ в Европе, успешно конкурируя с такими гигантами, как OpenAI и Google.