Мой агент по кодированию отвечает на каждый вопрос о моем стеке с полной уверенностью. В прошлом месяце я наконец задал вопрос, который должен был быть первым: насколько это правда? Я взял документацию по платформе, которой ежедневно пользуются мои агенты — игровую платформу...
Мой агент по кодированию отвечает на каждый вопрос о моем стеке с полной уверенностью. В прошлом месяце я наконец задал вопрос, который должен был быть первым: насколько это правда?
Эксперимент
Я взял документацию по платформе, на которую ежедневно полагаются мои агенты — RGS API игровой платформы, ее математический SDK, контрольный список одобрения — записал, на что агент должен иметь возможность ответить, сформулировал на основе этого около 30 контрольных вопросов и оценил ответы агента по реальным документам.
Он набрал около 40%. Хуже всего был не счет, а то, что каждый неправильный ответ звучал точно так же, как и каждый правильный. Та же уверенность, та же беглость, те же блоки кода. Данные обучения модели были просто старше документации, и ничто в разговоре не могло сказать мне, какие ответы были из 2024 года.
Контекстные файлы это не исправляют.
Стандартное исправление - это папка CLAUDE.md/skills/сервер MCP памяти. У меня были все три. Сохранились три проблемы:
Вы платите за каждое слово, за каждый сеанс — весь файл передается независимо от того, нужно оно задаче или нет.
Они гниют молча. Файл, написанный в марте, к июню уже уверенно ошибается, и вам об этом ничего не говорит.
Вы не можете их измерить. Никто не знает, что на самом деле содержит папка с уценкой, пока