Hume AI представила Octave 2 — синтез речи на 11 языках с эмоциями и скоростью ответа менее 200 мс

Новый уровень синтеза речи
Hume AI, компания из Сан-Франциско, представила вторую версию своей системы Octave - инструмент для преобразования текста в речь (TTS), который теперь поддерживает 11 языков и генерирует аудио практически мгновенно. В отличие от традиционных синтезаторов, Octave 2 опирается на языковую модель, способную учитывать контекст и эмоции.
Пользователь может попросить: «прочитай это с ноткой удивления» - и система мгновенно меняет интонацию. Такой подход сближает синтез речи с живым голосом, а не с роботизированным звучанием прошлых поколений.
Скорость и стоимость
В Octave 2 время отклика сократилось до менее чем 200 миллисекунд, что на 40% быстрее первой версии. Цена использования упала на 50%, благодаря чему технология стала доступнее для небольших студий и разработчиков мобильных приложений. Теперь интеграция реалистичных голосов в реальном времени в чат-боты, виртуальных ассистентов или аудиокниги становится гораздо проще.
Многоязычность и эмоции
Octave 2 работает не только с английским, но и с испанским, французским, немецким, японским, хинди и другими языками. Всего их 11 - это делает систему универсальным инструментом для глобальных приложений. Более того, Hume AI позиционирует Octave как «голосовой мозг» - не просто TTS, а технологию эмоционального общения.
Компания уже тестирует возможности изменения акцентов и стилей речи. Первые отзывы энтузиастов на Reddit и Threads подтверждают реалистичность звучания: «Голос будто записан человеком в студии».
Планы на будущее
Вместе с Octave 2 Hume AI представила и EVI 4 mini - компактный голосовой ИИ для устройств с ограниченными ресурсами. Сейчас доступна бета-версия Octave 2 через API на hume.ai, а полноценный релиз обещают в ближайшие месяцы.
Разработчики отмечают, что комбинация скорости, многоязычности и эмоциональности делает Octave 2 востребованным инструментом - от корпоративных решений до креативных проектов.