Рекомендательные системы, основанные на больших языковых моделях, могут выдавать контекстуальные и объяснимые предложения, но они также вводят «налог на задержку», которого никогда не было у традиционных конвейеров матричной факторизации. В производстве каждая миллисекунда...
Рекомендательные системы, основанные на больших языковых моделях, могут выдавать контекстуальные и объяснимые предложения, но они также вводят «налог на задержку», которого никогда не было у традиционных конвейеров матричной факторизации. В производственной среде каждая миллисекунда между действием пользователя и выдачей рекомендаций влияет на вовлеченность. В этом руководстве рассматриваются конкретные методы сокращения этого разрыва без ущерба для качества модели, а также способы запуска этих рабочих нагрузок в инфраструктуре вывода, созданной для повышения скорости.
Разложите свой бюджет задержки
Рекомендация на основе LLM обычно представляет собой многоэтапный конвейер: поиск кандидатов, быстрая сборка, вывод и постобработка. Перед оптимизацией профилируйте каждый этап с помощью распределенной трассировки. Часто вы обнаружите, что накладные расходы сети и быстрое построение занимают от 30 до 50 процентов общей задержки, в то время как фактическая генерация токенов является лишь частью проблемы. Сначала отремонтируйте окружающую сантехнику.
Сократите подсказку, сохраните сигнал
Длинные истории пользователей и подробные описания элементов раздувают подсказку и увеличивают время получения первого токена. Усекать историю до последних N взаимодействий, которые коррелируют с текущим намерением сеанса, и вместо этого сжимать метаданные элемента в структурированные пары ключ-значение.