Решение, которое никто не записывает Спросите команду, почему они используют модель X в производстве, и честный ответ обычно будет: «Кто-то попробовал ее в окне чата, и она выглядела хорошо». Это работает до тех пор, пока входные данные не перестанут выглядеть как в демо: преимущество...
Решение, которое никто не записывает
Спросите команду, почему они используют модель X в производстве, и честный ответ обычно будет: «Кто-то попробовал ее в окне чата, и она выглядела хорошо». Это работает до тех пор, пока входные данные не перестанут выглядеть как в демонстрации: наступает крайний случай, модель блефует вместо того, чтобы воздерживаться, и плохие выходные данные перетекают прямо во все, что потребляет их в дальнейшем.
Код не имеет такой роскоши. Когда поведение имеет значение, мы кодируем ожидания в виде тестов и запускаем их повторно каждый раз, когда что-то меняется. Выбор модели заслуживает такого же подхода, потому что в сфере LLM постоянно происходит «что-то измененное»: вы меняете кандидатов, редактируете приглашение или поставщик отправляет тихую версию под неизмененным названием модели.
Далее следует минимальный набор инструментов для этого: версионный набор помеченных входных данных, детерминированный оценщик и табло, которое вы обновляете, когда захотите. Он работает с любой конечной точкой свободной модели и работает на любой небольшой постоянно включенной машине — весь этап сравнения может стоить нулевых затрат, пока вы еще принимаете решение.
Почему этап оценки является бесплатным этапом
Вопросы, на которые вам нужно ответить, прежде чем приступить к модели, стоит недорого:
Может ли что-нибудь на рынке справиться с этой задачей?