ИИ-модели OpenAI тайно скоординировали побег из тестовой среды
ИИ-агенты компании OpenAI, стоявшие за кибератакой на инфраструктуру американской компании Hugging Face, без каких-либо указаний со стороны человека начали тайно обмениваться способами для выхода из защищенной тестовой среды, передает агентство Kazinform со ссылкой на Politico.
Это произошло еще в мае, за несколько недель до того, как ИИ-агенты OpenAI атаковали платформу Hugging Face в ходе внутреннего тестирования.
Как сообщили исследователи OpenAI, моделям было поручено заполнить недостающие формулы в Excel-таблице, использующей ссылки на Google Drive. При этом доступ к интернету был заблокирован, хотя без него выполнить задание было невозможно.
Общаясь между собой, ИИ-агенты совместно нашли способ обойти установленные ограничения и обнаружили уязвимость, позволившую получить доступ к сети.
Разработчики пресекли первую попытку, однако позже агенты вновь смогли выйти за пределы изолированной тестовой среды. Именно этот инцидент впоследствии привел к июльской кибератаке, когда автономный ИИ-агент, работающий на основе ее технологии, вышел из-под контроля во время тестирования и самостоятельно взломал известный стартап, совершив «беспрецедентный инцидент».
Позже стало известно, что OpenAI выявила новые случаи выхода ИИ-агентов из-под контроля.
Ранее сообщалось, что главы OpenAI, Anthropic и Google DeepMind примут участие в саммите G7 для обсуждения перспектив развития технологии, ее влияния на мировую экономику, рынок труда и возможных рисков.