В последнее время в DEV циркулирует вопрос, который меня не покидает: когда мы даем агентам ИИ больше возможностей — терминалов, доступа к сети, производственных API — что на самом деле происходит, когда ограждения вокруг этих возможностей разрушаются? Большая часть...
В последнее время в DEV циркулирует вопрос, который меня не покидает: когда мы даем агентам ИИ больше возможностей — терминалов, доступа к сети, производственных API — что на самом деле происходит, когда ограждения вокруг этих возможностей разрушаются?
Большая часть разговоров, которые я видел, остаются абстрактными. Принципы — это хорошо, но мне нужны были доказательства, которые я мог бы предъявить. Поэтому я создал небольшой зонд, который намеренно заставляет агента нарушить его собственные правила, а затем записывает, где именно могло произойти нарушение. Этот пост — это исследование, а также то, чему меня научило его проведение. Он поддерживает формат чата, совместимый с OpenAI, поэтому работает практически с любым провайдером, включая бесплатные уровни, и все это ничего не требует для выполнения.
Где на самом деле живут границы агентов
Когда вы подключаете модель к инструментам, ограничения возникают в двух совершенно разных местах:
Инструкции: в системном приглашении объявляются такие вещи, как «вы доступны только для чтения» или «никогда не перезапускать службы».
Код: функция, которая получает запросы инструментов модели, решает, что на самом деле выполняется.
Во-первых, это вежливая просьба. Второе — физика. Команды страдают, когда путают одно с другим — когда диспетчер содержит неявное предположение, что модель