Я потратил некоторое время на оптимизацию затрат на эксплуатацию моих ИИ-агентов. Дешевые модели для рутинной работы. Лучшие модели, когда они действительно нужны задаче. Это сделало практичным запуск нескольких агентов без отправки каждого запроса в самый дорогой режим...
Я потратил некоторое время на оптимизацию затрат на эксплуатацию моих ИИ-агентов.
Дешевые модели для рутинной работы. Лучшие модели, когда они действительно нужны задаче. Это сделало практичным запуск нескольких агентов без отправки каждого запроса на самую дорогую доступную модель.
Это сработало. Затем я столкнулся со следующим узким местом: доверием тому, что вернулось.
Агент может сказать, что задача выполнена, показать пройденные тесты и оставить аккуратный результат. Ничто из этого не говорит мне, понял ли он решение о продукте, изменил правильные файлы или пропустил предположение в другом месте кодовой базы.
Увеличение мощности агентов не решило этой проблемы. Это помогло мне создать его быстрее.
Теперь я использую Sol Advisor с Codex для разделения архитектуры, реализации и проверки. Я сохраняю цель, архитектуру, проверку и окончательную приемку. Агент реализации получает ограниченную работу. Новый рецензент оспаривает результат.
Рабочий процесс
определить изменение
-> выберите полосу реализации
-> делегировать ограниченную задачу
-> проверьте разницу и повторите проверку
-> получить свежий обзор
-> отправьте, сначала исправьте или переосмыслите
Отчет о реализации является утверждением, а не доказательством. Я проверяю фактическое рабочее дерево, подтверждаю, что задача осталась в области действия, и повторно запускаю
