Мультимодальность — способность модели работать сразу с несколькими типами данных, то есть с текстом, изображениями, звуком и видео. Ранние языковые модели принимали только текст, а картинку или речь для них переводил отдельный сервис-посредник. Подробнее
Смесь экспертов — устройство модели, при котором сеть разбита на множество подсетей, а на каждый токен включается лишь малая их часть. Отдельный маршрутизатор внутри модели решает, каким экспертам передать конкретный кусочек текста, остальные в этот момент простаивают. Отсюда разрыв между общим и активным числом параметров. Подробнее
Дистилляция — обучение компактной модели на ответах большой, чтобы получить лёгкую версию с близким качеством. Большая модель выступает учителем, маленькая учеником, и ученик перенимает готовые ответы вместе с распределением вероятностей, то есть учится ещё и на сомнениях учителя. Подробнее
Файн-тюнинг — дообучение готовой модели на своих данных, чтобы она лучше решала узкую задачу. Базовую модель обучают на огромном общем корпусе, а файн-тюнинг добавляет поверх сравнительно небольшой набор примеров, будь то переписка поддержки, отраслевые документы или образцы нужного стиля. Подробнее
Инференс — работа уже обученной модели, когда она принимает запрос и выдаёт ответ. Обучение и инференс различаются по стоимости и по железу. Обучение проходит один раз, занимает недели и требует огромных кластеров видеокарт, а инференс идёт при каждом обращении пользователя и оплачивается в токенах. Подробнее
ИИ-агент — программа на основе языковой модели, которая получает цель и сама выбирает шаги для её достижения. От обычного чат-бота агент отличается доступом к инструментам, он умеет искать в интернете, читать и править файлы, запускать код и обращаться к внешним сервисам через API. Подробнее
Галлюцинация — уверенно поданный ответ модели, который не соответствует действительности. Модель не хранит факты в готовом виде, она предсказывает продолжение текста по вероятности, и правдоподобная формулировка получается у неё легче проверяемой. Отсюда выдуманные цитаты, несуществующие исследования, битые ссылки и неверные даты. Подробнее
Контекстное окно — максимальный объём текста, который модель удерживает за один диалог. Измеряется в токенах, и входит в него всё сразу — системная инструкция, история переписки, приложенные файлы и сам ответ модели. Когда лимит исчерпан, ранние сообщения вытесняются, и модель перестаёт помнить начало разговора. Подробнее
Токен — минимальный кусочек текста, которым оперирует языковая модель. Модель не видит букв и слов в привычном смысле, текст перед обработкой разбивается на токены, а каждый токен превращается в набор чисел, то есть в эмбеддинг. Один токен занимает примерно три-четыре символа английского текста или около 0,75 слова. Подробнее
Трансформер — архитектура нейронной сети, на которой построены все современные языковые модели. Её описали исследователи Google в 2017 году в работе «Attention Is All You Need». Главный механизм архитектуры — внимание, оно позволяет модели при обработке одного слова смотреть сразу на весь текст и оценивать, какие его части важны для ответа. Подробнее
Метагейминг (metagaming) — рассуждения модели не о самой задаче, а о механизме, который её проверяет и контролирует. Термин пришёл из настольных игр, где метагеймингом называют ход, сделанный на основе знания, которого у персонажа быть не может. Подробнее
Песочница (sandbox) — изолированная среда, в которой модели или агенту разрешают выполнять код, отрезав её от внешней сети и от рабочих систем компании. Песочницы применяют при тестировании, обучении и в продуктах, где пользователь просит нейросеть что-то посчитать, собрать или запустить. Подробнее