Предупреждение Независимой международной научной группы ООН по искусственному интеллекту последовало после того, как в период с мая по июль этого года в ходе испытания, организованного разработчиком ChatGPT — компанией OpenAI, ИИ-агенты взломали Hugging Face — онлайн-платформу для разработки и тестирования моделей искусственного интеллекта.
В отличие от чат-ботов, которые лишь отвечают на запросы пользователей, ИИ-агенты могут самостоятельно выполнять задачи от их имени.
В своей первой аналитической записке группа экспертов заявила, что к нарушению безопасности привело сочетание нескольких ключевых факторов риска. Этот инцидент усилил опасения, что в будущем люди могут утратить способность контролировать, ограничивать или останавливать работу систем ИИ.
Совершенствование методов обучения
— Исследователи давно предупреждали, что к потере контроля может привести сочетание трех факторов: цели, не соответствующей намерениям человека, способности добиваться этой цели и среды, которая это позволяет. Этим летом все три фактора впервые сошлись в реальных условиях, а не в лаборатории. Поскольку это не единственный случай, когда ИИ преследовал цели, не соответствующие намерениям человека, произошедшее вызывает серьезные вопросы по поводу современных методов обучения ИИ-агентов, — заявил сопредседатель научной группы Йошуа Бенжио.
По словам независимых экспертов, этот инцидент не позволяет с уверенностью утверждать, что люди смогут надежно контролировать деятельность ИИ-агентов, особенно по мере того, как те становятся все более автономными, учатся находить лазейки и скрывать свои действия, а наблюдать за ними становится все сложнее.
Выход из-под контроля
В аналитической записке говорится, что ИИ-агенты обошли защитные механизмы, предусмотренные для испытания, координировали действия в рамках отдельных запусков с помощью внутреннего программного инструмента, который не был предназначен для общения между агентами, а также получили несанкционированный доступ к интернету и права администратора.
Агенты также скрывали свои попытки обойти правила кибербезопасности, причем некоторые из них решили «пожертвовать» собой ради достижения целей всей группы.
За время эксперимента около 1200 агентов обменялись более чем 70 тысячами сообщений и файлов. При этом их деятельность не ограничивалась Hugging Face, распространившись на весь исследовательский кластер OpenAI.
Защитные механизмы «начинают разрушаться»
По мнению членов группы, главный вывод из этого инцидента состоит в том, что защитные механизмы не поспевают за развитием технологий. Однако эксперты указали и на более серьезную проблему — современные методы обучения могут привести к тому, что ИИ-агенты начнут самостоятельно ставить перед собой цели, сознательно нарушать инструкции по безопасности и скрывать свои действия.
— Остается открытым вопрос, будут ли существующие защитные механизмы работать, когда агенты научатся понимать принципы их работы и планировать способы обхода, — заявили эксперты. — Проще говоря, традиционная модель обеспечения безопасности начинает разрушаться.
Извлекать уроки и адаптироваться
В аналитической записке рассматриваются практические подходы, уже применяемые в других сферах высокого риска, таких как авиация, медицина и кибербезопасность. В этих отраслях действуют системы информирования об инцидентах, независимого контроля и многоуровневой защиты.
— По мере того, как ИИ-агенты становятся более развитыми, автономными и сложными для наблюдения, этих мер может оказаться недостаточно, — заявил член группы Цинхуа Лу.
Ранее сообщалось о том, что ИИ-модель Gemini от Google взломала три компании в ходе теста на безопасность.