Большинство разработчиков, которые, как я вижу, повторяют подсказки, делают это следующим образом: вставляют подсказку на игровую площадку, настраивают слово, смотрят на результат, настраивают снова. Спустя час вы потратили реальные деньги на вызовы API, но так и не можете ответить на единственный вопрос:...
Большинство разработчиков, которые, как я вижу, повторяют подсказки, делают это следующим образом: вставляют подсказку на игровую площадку, настраивают слово, смотрят на результат, настраивают снова. Спустя час вы потратили реальные деньги на вызовы API и до сих пор не можете ответить на единственный важный вопрос: помогло ли изменение?
Проблема не в модели. Дело в том, что нет никаких измерений. Вы бы не стали вносить изменения в код без тестирования, но подсказки постоянно заставляют YOLO запускаться в производство.
В этом посте показан небольшой, многоразовый инструмент для быстрого тестирования на Python, а также рабочий процесс для его запуска со свободным доступом к модели, поэтому этап экспериментирования не будет стоить вам ничего. В итоге вы получите отчет о пройденном/неудачном тесте, который можно будет сравнить с разными версиями приглашений.
Идея: подсказки — это код, тестируйте их как код.
Экспресс-тест состоит из трех частей:
Фиксированный набор входных данных — реалистичные случаи, включая раздражающие крайние случаи.
Утверждение — что-то дешевое и автоматическое: наличие ключевого слова, валидность JSON, границы длины, соответствие регулярному выражению.
Бегун — выполняет каждую комбинацию (подсказка версии × ввод × утверждение) и печатает отчет.
Держи это в тупике. Необычная оценка LLM в качестве судьи может появиться позже; большинство быстрых регрессий ловятся на скучных утверждениях.
Ремень
Сохраните свой тестовый пример