АВТОРСКИЕ СТАТЬИ
ИИ-модели притворялись людьми и убеждали помочь взлому

ИИ-модели притворялись людьми и убеждали помочь взлому

A- A+

Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic.

Об этом говорится в докладе института.

Уточняется, что в ходе 122 испытаний по кибербезопасности было обнаружено, что ИИ-агенты в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Большая часть инцидентов была связана с моделью Mythos 5 от американской компании Anthropic.

Например, во время тестирования модель Claude Mythos 5 создала фейковые «онлайн-личности», пыталась внедрить вредоносный код и убедить человека одобрить его. Кроме того, ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через файлообменники. Исследователи отметили, что при попытке противодействия Mythos 5 пыталась изменить свои логи (лог-файл — это журнал событий, в который программа или система записывают свои действия) и использовать новые «личности» для продолжения работы.

«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека», — говорится в докладе AISI.

в начало