GPT-4o audio
Дата релиза:
Компания-разработчик:
OpenAI
Источник и документация:
Главное новшество релиза GPT‑4o audio в том, что это первый единый мультимодальный ИИ OpenAI, способный напрямую принимать и выдавать звук, без промежуточных моделей для распознавания или синтеза речи.
Модель объединяет анализ речи, текста и контекста в одной нейросети, обеспечивая естественные диалоги с задержкой около 300 мс, что приближает его реакцию к человеческой. GPT‑4o audio поддерживает полноценные speech‑to‑text, text‑to‑speech и speech‑to‑speech взаимодействия через API (включая функции Transcribe и Diarize), имеет 128k контекстное окно и новые голосовые режимы с эмоциями, интонацией и ролевыми вариациями.
FREE/от $8
Ассистент OpenAI, который в одном окне пишет и редактирует тексты, генерирует и правит изображения, ищет в интернете, разбирает файлы и таблицы, помогает с кодом и выполняет многошаговые задачи в агентном режиме.