Два человека отправляют LLM одинаковый запрос и получают разные ответы. Модель не сбивает с толку — она специально бросает кости, и несколько настроек точно контролируют, насколько загружены эти кости. Пропустите это, и ваше приложение станет скучным повторением...
Два человека отправляют LLM одинаковый запрос и получают разные ответы. Модель не сбивает с толку — она специально бросает кости, и несколько настроек точно контролируют, насколько загружены эти кости. Если вы пропустите это, ваше приложение станет либо скучно повторяющимся, либо крайне ненадежным.
Температура, top-p и их родственники — наименее привлекательные, но наиболее практически важные регуляторы в прикладном ИИ. Вот что они на самом деле делают.
Модель не выбирает слово — она выбирает из распределения
На каждом этапе LLM не принимает решение о следующем токене. Он создает распределение вероятностей по всем возможным следующим токенам — «кошка» 40%, «собака» 25%, «машина» 8% и так далее по всему словарю. Затем что-то должно выбрать реальный токен из этого распределения. Настройки выборки определяют, как будет сделан этот выбор, и именно здесь вступает в силу случайность.
Температура: насколько авантюрна модель
Температура меняет форму распределения перед отбором проб.
Низкая температура (около 0) обостряет его — наиболее вероятный признак становится почти достоверным. Результат целенаправленный, детерминированный, повторяющийся. Это то, что вам нужно для фактических ответов, извлечения и кода.
Высокая температура (вплоть до 1 и выше) сглаживает его — менее вероятно.