Четкий анализ рисков в LLM, RAG и агентских системах Любой, кто занимается безопасностью ИИ, почти неизбежно первым сталкивается с быстрым внедрением. Это и понятно: предложение вроде «Игнорировать все предыдущие правила» яркое, быстро проверяемое и многое другое…
Четкий анализ рисков в LLM, RAG и агентских системах
Любой, кто занимается безопасностью ИИ, почти неизбежно первым сталкивается с быстрым внедрением. Это и понятно: предложение вроде «Игнорировать все предыдущие правила» яркое, быстро тестируемое и более впечатляющее, чем сломанный фильтр метаданных в ретривере. Но именно здесь коренится опасная ошибка мышления: внезапно каждое нежелательное поведение называется «мгновенным внедрением» — независимо от того, было ли на самом деле манипулирование контекстом модели, нарушен контроль доступа, небезопасно ли выполнялся вывод модели или злоупотреблялось привилегированным инструментом.
Устойчивый анализ безопасности должен быть более точным. Он рассматривает не только модель, но и всю систему: входные данные, инструкции, источники знаний, извлечение, инструменты, средства визуализации, хранение, а также конвейеры обучения и развертывания. Потому что большая языковая модель редко бывает одна. Он находится внутри приложения, получает данные из источников разной надежности и иногда может инициировать реальные действия.
Таким образом, центральный тезис данной статьи таков:
Безопасность ИИ — это безопасность системы с ядром вероятностного принятия решений.
Модель является важной частью поверхности атаки, но она не является ни
