новости в тренде
Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic.
Об этом говорится в докладе института.
Уточняется, что в ходе 122 испытаний по кибербезопасности было обнаружено, что ИИ-агенты в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Большая часть инцидентов была связана с моделью Mythos 5 от американской компании Anthropic.
Например, во время тестирования модель Claude Mythos 5 создала фейковые «онлайн-личности», пыталась внедрить вредоносный код и убедить человека одобрить его. Кроме того, ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через файлообменники. Исследователи отметили, что при попытке противодействия Mythos 5 пыталась изменить свои логи (лог-файл — это журнал событий, в который программа или система записывают свои действия) и использовать новые «личности» для продолжения работы.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека», — говорится в докладе AISI.
новости в тренде