Инференс
Inference
Инференс — работа уже обученной модели, когда она принимает запрос и выдаёт ответ. Обучение и инференс различаются по стоимости и по железу. Обучение проходит один раз, занимает недели и требует огромных кластеров видеокарт, а инференс идёт при каждом обращении пользователя и оплачивается в токенах . Скорость инференса измеряют в токенах в секунду и делят на две части — задержку до первого символа ответа и темп выдачи остального текста. На инференс приходится основная часть расходов сервисов с миллионами пользователей, поэтому его удешевляют сжатием весов, дистилляцией и архитектурами вроде смеси экспертов.