Есть команда, гибель которой я помню особенно хорошо. Они создали агента по обслуживанию клиентов с «профилем пользователя» — пользователь говорит «Я VIP-клиент, Чжан Вэй» один раз и в каждом разговоре после того, как агент «вспомнит». Менеджер по продукту...
Есть команда, гибель которой я помню особенно хорошо. Они создали агента по обслуживанию клиентов с «профилем пользователя» — пользователь говорит «Я VIP-клиент, Чжан Вэй» один раз и в каждом разговоре после того, как агент «вспомнит». Менеджер по продукту спросил в демо: «Вы меня запомните?» — «Конечно, я всегда буду помнить вас, господин Чжан». Они дали пять и отправили. В первый день производства клиент сообщил: «Ваш ИИ говорит, что не знает меня».
Ни одна строка кода не была неправильной. Ошибочным было предположение, что метод talk.append() может загружать память в модель. LLM API — это чистая функция — ответ = f(сообщения, параметры). Ни сеанса, ни файлов cookie, ни состояния перекрестного запроса. С момента выпуска они просто каждый раз дословно вставляли длинный журнал чата обратно в API: забывали заполнить, обрезать или перезапустить контейнер, а памяти никогда не существовало. Сущность памяти заключена в вашем коде и базе данных, а не в модели.
Мое мнение: инженерная зрелость уровня памяти часто является решающим фактором в том, сможет ли система когда-либо выйти на рынок. Модели можно менять местами, структуры переписывать, но если уровень памяти спроектирован неправильно, все данные предыдущего разговора станут мусором и