Цикл оценки модели за 0 долларов перед следующей заменой модели Ноль долларов, один бесплатный сервер и оценочная программа из двадцати случаев могут заменить неделю смены моделей на основе таблицы лидеров. Команды продолжают внедрять новейшую модель, потому что результаты тестов впечатляют...
Цикл оценки модели за 0 долларов перед следующей заменой модели
Ноль долларов, один бесплатный сервер и оценочная программа из двадцати случаев могут заменить неделю смены моделей на основе таблицы лидеров. Команды продолжают использовать новейшую модель, поскольку результаты тестов улучшились, а затем в процессе производства обнаруживают, что модель не соответствует конкретным форматам подсказок. В этой статье описан воспроизводимый рабочий процесс, в котором используется бесплатный доступ к модели и бесплатный сервер для запуска частного цикла оценки, прежде чем какая-либо модель достигнет вашей кодовой базы. Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode.
Несоответствие общедоступных тестов и фактического распределения задач является основной проблемой. Модель может находиться на вершине таблицы лидеров, продолжая создавать неверный JSON, игнорировать схемы инструментов или не справляться с пограничными случаями, с которыми ваши пользователи сталкиваются ежедневно. Небольшая частная оценка не обязательно должна быть дорогостоящей: если у вас есть доступ к бесплатному выводу модели и бесплатной среде выполнения на сервере, вы можете запустить целенаправленную программу примерно за ту же цену, что и локальный сценарий.
Минимальный оценщик модели
Приведенный ниже жгут представляет собой неисполняемый псевдокод. Предполагается, что вы можете вызвать модель через конечную точку HTTP, но оставляет точную форму полезных данных и аутентификацию на усмотрение