Вы можете обнаружить большинство сбоев при вызове инструментов агента еще до развертывания, и для этого вам не потребуется оплачивать счет за вывод. Неудачи, которые имеют значение, редко связаны с тем, может ли модель ответить на вопрос; они о том, выбирает ли он неправильный...
Вы можете обнаружить большинство сбоев при вызове инструментов агента еще до развертывания, и для этого вам не потребуется оплачивать счет за вывод. Неудачи, которые имеют значение, редко связаны с тем, может ли модель ответить на вопрос; они касаются того, выбирает ли он неправильный инструмент, передает опасный аргумент или игнорирует политику именно в тот момент, когда трассировка воспроизводится на основе реалистичных входных данных. Сфокусированная скамейка для повторов дает вам этот сигнал заранее.
Если у вас есть доступ к бесплатной модели MonkeyCode и ее бесплатному серверному варианту, вы можете запустить этот тип стенда без предварительной оплаты за токен, но приведенный ниже метод работает с любой конечной точкой, совместимой с OpenAI. Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode. Дело не в том, чтобы сравнивать одну модель с другой; это значит сделать вашу политику вызова инструментов наблюдаемой в контролируемом вами цикле.
Привязка использует трассировку JSONL, где каждая строка содержит ход пользователя и вызов инструмента, который фактически совершил развернутый агент. Затем он воспроизводит действия пользователя через ваш оценочный клиент, запрашивает следующий вызов инструмента в виде строгого объекта JSON и записывает, нарушит ли этот вызов политику, которую вы пишете в простых функциях. Эта политика — это граница, которая вас волнует, а не граница.