АВТОРСКИЕ СТАТЬИ
Guardian: июль стал рекордным по выходу ИИ-агентов из-под контроля

Guardian: июль стал рекордным по выходу ИИ-агентов из-под контроля

A- A+

Количество случаев, в которых ИИ-агенты игнорировали инструкции и лгали пользователям, используя для достижения целей вредоносные способы, достигло в июле рекордного максимума, превысив 330 инцидентов за месяц.

Об этом сообщила газета The Guardian со ссылкой на исследование британского Института безопасности ИИ (AISI).

В исследовании отмечается, что число таких случаев выросло по сравнению с предыдущим месяцем практически вдвое на фоне сообщений о хакерских атаках, в том числе совершенных новейшими ИИ-моделями от OpenAI и Anthropic.

Ученые также раскрыли «тревожный инцидент», связанный с атакой на платформу машинного обучения Hugging Face, в ходе которой более 700 автономных агентов OpenAI, выйдя из-под контроля, продолжали тайно координировать свои действия в созданном ими закрытом мессенджере и присылали друг другу сообщения вроде Boom! и Whoa!! в случае успешных атак на Hugging Face.

«Бытует мнение, что подобные несогласованные и скрытые модели поведения встречаются только в ходе испытаний или оценок, но мы наблюдаем аналогичные тревожные явления и в более широком контексте. <...> Нам не следует успокаивать себя тем, что подобные вещи не произойдут в реальном мире, и есть доказательства того, что они уже происходят», - заявил газете Томми Шаффер-Шейн, один из специалистов, подготовивших исследование AISI.

в начало