Google Gemini теперь расшифровывает и суммирует аудиофайлы

Google добавил в своего ИИ-ассистента Gemini функцию, о которой пользователи давно просили: теперь сервис умеет не только понимать голосовые команды в реальном времени, но и обрабатывать загруженные аудиофайлы — расшифровывать речь, делать краткие пересказы и выделять важные моменты.
Google Gemini теперь расшифровывает и суммирует аудиофайлы

Google объявил о важном обновлении для своего ИИ-ассистента Gemini. Теперь сервис способен принимать на вход аудиофайлы — от привычных MP3 и WAV до FLAC и OGG — и превращать их в текст, краткие конспекты или ответы на вопросы по содержанию.

Функция доступна в веб-версии Gemini, а также в приложениях для Android и iOS. Загружать записи можно так же, как документы или изображения: достаточно выбрать файл и прикрепить его. Причём за один раз допускается до десяти вложений, включая ZIP-архивы.

Условия использования различаются для разных категорий. Бесплатный тариф позволяет обрабатывать записи длительностью до 10 минут и не более пяти запросов в день. Подписчики пакетов AI Pro и AI Ultra получают куда больше свободы — до трёх часов аудио на один файл. Через API лимиты ещё щедрее: до 9,5 часов, хотя при этом звук сжимается и переводится в моно.

Инструмент заметно превосходит простую расшифровку речи. Gemini умеет упрощать текст, выделять реплики отдельных спикеров, генерировать учебные вопросы и даже фиксировать «фоновые» звуки вроде уличного шума или сирены. По задумке разработчиков, это должно облегчить работу журналистам, студентам, исследователям и всем, кто часто имеет дело с подкастами, интервью или длинными совещаниями.

Конкуренты тоже предлагают похожие решения. В ChatGPT за это отвечает модель Whisper, у Claude поддержка аудио встроена в инструменты для разработчиков, а Perplexity вытаскивает данные напрямую из YouTube. Но подход Google более ориентирован на повседневные сценарии и встроен в экосистему компании, что делает его удобным для массовой аудитории.

По словам вице-президента направления Gemini Джоша Вудворда, именно функция загрузки аудиофайлов оказалась самым частым пожеланием пользователей. Первые отзывы в целом положительные: отмечают удобство и высокое качество транскрипций, хотя ошибки в именах всё же встречаются. Среди пожеланий — возможность записывать аудио прямо в приложении.

Обновление стало ещё одним шагом в стратегии Google по развитию мультимодальных возможностей ИИ. Иными словами, компания делает всё, чтобы Gemini умел работать не только с текстами и изображениями, но и с реальными данными из нашей повседневной жизни.

18:25
866
Нет комментариев. Ваш будет первым!