Агент ИИ читает скрытую инструкцию на веб-странице. Инструкция выглядит полезной, поэтому агент сохраняет ее. Сеанс заканчивается. Несколько недель спустя другая задача извлекает эту запись как доверенный контекст. Это класс постоянного риска, который...
Агент ИИ читает скрытую инструкцию на веб-странице. Инструкция выглядит полезной, поэтому агент сохраняет ее. Сеанс заканчивается. Несколько недель спустя другая задача извлекает эту запись как доверенный контекст. Это класс постоянного риска, который проект безопасности OWASP GenAI описывает как отравление памяти и контекста.
Исходная быстрая инъекция исчезла. Память о нем остается.
Это неприятное свойство долговременной памяти агента: постоянство продлевает жизнь полезному контексту, но оно может продлить жизнь и плохому контексту. Система памяти не становится безопасной, если она извлекает наиболее похожее предложение. Он становится работоспособным, когда команда может управлять тем, что попадает в память, идентифицировать достоверную запись, проверять, почему был возвращен более поздний отзыв, и намеренно исправлять или стирать состояние.
Это центральный аргумент нашего нового публичного препринта:
SuperLocalMemory 4.0: операционная система управляемой памяти для агентов ИИ
Статья доступна под номером arXiv:2608.08253. Реализация имеет открытый исходный код на GitHub, а сопутствующий цитируемый архив находится на Zenodo.
В документе не утверждается, что один продукт памяти решает все проблемы безопасности агентов. Он приводит более узкий инженерный аргумент: однажды
