Мультимодальность
Multimodality
Мультимодальность — способность модели работать сразу с несколькими типами данных, то есть с текстом, изображениями, звуком и видео. Ранние языковые модели принимали только текст, а картинку или речь для них переводил отдельный сервис-посредник. Нативно мультимодальная модель обучена на разных типах данных с самого начала и сводит их в общее внутреннее представление, тот же эмбеддинг , поэтому связывает содержание картинки с вопросом напрямую. Отсюда сценарии вроде разбора скриншота с ошибкой, чтения схемы на фотографии или перевода речи на слух. Возможности по типам данных обычно несимметричны, и модель, которая понимает видео на входе, далеко не всегда умеет его создавать.