Перекрестный пост. Оригинал: stellarbytecapital.com/blog/ai-agent-security-threat-model. Пока чат-бот только генерирует текст, автономный агент выполняет действия: вызывает инструменты, запускает код, перемещает данные и тратит деньги. Этот сдвиг меняет безопасность...
Перекрестный пост. Оригинал: stellarbytecapital.com/blog/ai-agent-security-threat-model.
Пока чат-бот только генерирует текст, автономный агент выполняет действия: вызывает инструменты, запускает код, перемещает данные и тратит деньги. Этот сдвиг полностью меняет проблему безопасности. «Безопасна ли подсказка?» это уже не вопрос. Вопрос в том, что может сделать этот агент и что его останавливает, когда что-то идет не так?
Относясь к безопасности агентов как к быстрой фильтрации, команды получают впечатляющую демонстрацию и производственный инцидент. Вам нужна модель угроз. Вот наш.
Три плоскости атаки
Воздействие агента существует в трех различных плоскостях. Их сбивает с толку то, почему защита промахивается:
Плоскость модели — то, что входит в LLM и выходит из него: подсказки, полученные документы, выходные данные инструментов, возвращаемые в качестве контекста.
Плоскость действий — инструменты, которые агент может вызывать: оболочка, HTTP, база данных, файловый ввод-вывод, платежи и сторонние инструменты/серверы MCP.
Плоскость времени выполнения — где фактически выполняются код и инструменты агента: процесс, контейнер, хост и сеть.
Фильтрация подсказок затрагивает только первую плоскость. Наибольший реальный ущерб случается на втором и третьем.
Модель угроз
Угроза
вектор
Первичный контроль
Быстрая инъекция
Мали