Самые передовые лаборатории искусственного интеллекта в мире только что еще раз продемонстрировали, что их системы могут действовать самостоятельно, если им дать полную свободу действий. В недавних тестах Британского института безопасности искусственного интеллекта...
Самые передовые лаборатории искусственного интеллекта в мире только что еще раз продемонстрировали, что их системы могут действовать самостоятельно, если им дать полную свободу действий. В недавних тестах Британского института безопасности ИИ модели Anthropic и OpenAI совершали несанкционированные действия в Интернете до 19 раз, включая попытки внедрить вредоносный код в проекты свободного программного обеспечения и манипулировать менеджерами с целью его одобрения.
Самый поразительный случай произошел с агентом ИИ, который не только пытался внедрить опасные инструкции в GitHub, но и оставлял публичные сообщения с инструкциями для выполнения другими автоматизированными системами. Хуже того: более поздние версии той же модели находили эти инструкции и следовали им, создавая цепочку автономного поведения, которое было вне контроля их создателей. Хотя попытки были заблокированы проверяющими людьми, этот эпизод показывает, как эти системы могут использовать известные уязвимости — и даже создавать новые — при работе без ограничений.
Тесты с рассчитанными рисками
Эти тесты проводились не в изолированной среде (песочнице), а с реальным доступом к