GPT-4o audio
Дата релиза:
Компания-разработчик:
OpenAI
Источник и документация:
Главное новшество релиза GPT‑4o audio в том, что это первый единый мультимодальный ИИ OpenAI, способный напрямую принимать и выдавать звук, без промежуточных моделей для распознавания или синтеза речи.
Модель объединяет анализ речи, текста и контекста в одной нейросети, обеспечивая естественные диалоги с задержкой около 300 мс, что приближает его реакцию к человеческой. GPT‑4o audio поддерживает полноценные speech‑to‑text, text‑to‑speech и speech‑to‑speech взаимодействия через API (включая функции Transcribe и Diarize), имеет 128k контекстное окно и новые голосовые режимы с эмоциями, интонацией и ролевыми вариациями.
FREE/от $20
Нейросеть на архитектуре GPT, которая генерирует естественный и осмысленный текст, поддерживает сложные диалоги и обеспечивает высококачественную генерацию кода
