Alibaba запускает Qwen3-ASR-Toolkit для транскрипции длинных записей

Qwen3-ASR-Toolkit — новый open-source инструмент, построенный на базе модели Qwen3-ASR-Flash. В отличие от API-версии с лимитом в 3 минуты, этот пакет позволяет расшифровывать аудиофайлы любой длины.
Технология
Qwen3-ASR-Flash появилась всего неделю назад, но уже получила высокие оценки за точность. Модель основана на мультимодальной архитектуре Qwen3-Omni, обучена на десятках миллионов часов аудио и поддерживает 11 языков, включая русский. Она не только распознаёт речь, но и автоматически отсекает шум и неречевые сегменты.
Как начать пользоваться
Полный код и документация выложены на GitHub, а чтобы запустить Qwen3-ASR-Toolkit, нужно:
Установить Python версии 3.8 или выше.
Установить FFmpeg (подходит для Windows, macOS и Linux).
Получить API-ключ от платформы DashScope (Alibaba Cloud).
Установить инструмент одной командой:
\npip install qwen3-asr-toolkit\n
Для запуска достаточно одной строки:
\nqwen3-asr -i \"путь_к_файлу.mp4\"\n
Инструмент использует Voice Activity Detection (VAD), чтобы разбивать длинные файлы на фрагменты по естественным паузам. Параллельная обработка (по умолчанию 4 потока, с возможностью увеличить до 8+) позволяет заметно ускорить работу, особенно при транскрипции часовых лекций.
Совместимость
Поддерживаются популярные форматы видео (MP4, MOV, MKV) и аудио (MP3, WAV, M4A). Все записи автоматически приводятся к формату 16 кГц моно, что обеспечивает стабильное качество и универсальность обработки.
Для кого это полезно
Журналисты и исследователи, работающие с часами аудиоархивов.
Создатели подкастов и видеоблогеры, которым важно быстро готовить расшифровки.
Образовательные проекты и компании, где накоплены большие массивы лекций и онлайн-встреч.
Зачем это нужно
Alibaba делает шаг к демократизации ИИ. Бесплатный доступ к мощной модели и удобному инструменту открывает дорогу для массового использования транскрипции. Это особенно актуально в условиях стремительного роста аудиоконтента — от онлайн-курсов до корпоративных встреч.