Позвольте мне рассказать вам о самой странной проблеме безопасности, которую мне пришлось объяснять нетехническим людям в этом году. Звучит выдуманно. Это не так. Вы можете атаковать ИИ компании, написав ему записку. Не взлом, как вы себе представляете. Никаких брейков...
Позвольте мне рассказать вам о самой странной проблеме безопасности, которую мне пришлось объяснять нетехническим людям в этом году. Звучит выдуманно. Это не так.
Вы можете атаковать ИИ компании, написав ему записку.
Не взлом, как вы себе представляете. Никакого взлома брандмауэра, никакого кражи пароля или кода. Вы просто пишете какие-то инструкции, прячете их там, где ИИ все равно будет читать, и ждете, пока он подчинится. Вот и вся атака. У него неуклюжее название, быстрое внедрение и он находится на вершине отраслевого списка рисков ИИ с момента его существования.
Вот почему это работает, простыми словами.
Агент ИИ работает по инструкциям, написанным на обычном языке. В этом вся суть, в этом волшебство. Загвоздка в том, что он не может достоверно отличить инструкции от вас и инструкции, скрытые в читаемом материале. Для ИИ это всего лишь слова. Ваша тщательная настройка и злонамеренное предложение, спрятанное в электронном письме, приходят в одном и том же формате, и в модели нет встроенного чувства «подождите, это не от моего босса».
Представьте себе помощника, которому вы сказали: «Пройдитесь по этому почтовому ящику и обработайте то, что запрашивает каждое письмо». Разумный. Большую часть дня все в порядке. Затем в одном электронном письме говорится: