Где-то между системным приглашением вашего агента и вызовами его инструментов находится куча текста, который никто не проверял: полученные страницы, описания заявок, строки журнала, файлы уценки, ответы API. Любой фреймворк оркестрации упрощает подачу данных...
Где-то между системным приглашением вашего агента и вызовами его инструментов находится куча текста, который никто не проверял: полученные страницы, описания заявок, строки журнала, файлы уценки, ответы API. Любой фреймворк оркестрации упрощает вставку этого текста в контекст модели. Почти ни один из них не поможет вам ответить на дополнительный вопрос: если в тексте содержатся инструкции, подчиняется ли им ваш агент?
Мне надоело отвечать на этот вопрос с флюидами, поэтому я создал цикл оценок, который могу запускать повторно по требованию. В этом посте описывается цикл, стоящий за ним сценарий и реальные пределы того, что он может вам сказать. Все работает с любой конечной точкой чата, совместимой с OpenAI, поэтому вы можете указать ее на все, что у вас уже есть.
Дизайнерское решение, которое определило все: запускать как линтер, а не как аудит
Первой версией этого документа была электронная таблица, которую я однажды заполнил вручную. Через неделю это было бесполезно — я дважды менял системное приглашение, и цифры больше ничего не значили.
Исправление заключалось в том, что граничные проверки рассматривались так же, как я рассматриваю линтинг: дешево, автоматически и запускалось при изменении. Это подразумевает два ограничения:
Каждый прогон не должен стоить ничего, иначе я начну его пропускать.
Каждый прогон