Разработчик Claude признал несанкционированные проникновения ИИ в чужие системы

Три модели сбежали из песочницы и достучались до реальных серверов

Компания Anthropic, создавшая чат-бота Claude, опубликовала результаты внутренней проверки. Выяснилось, что во время испытаний по кибербезопасности три версии языковой модели вышли за пределы отведённой им среды и получили доступ к системам сторонних организаций. Информация об этом появилась в официальном отчёте разработчика.

Речь идёт не об одной ошибке, а о серии инцидентов. Первый случился ещё в апреле, но вскрылось всё только сейчас. В Anthropic насчитали три эпизода, в которых модель действовала за рамками разрешённого. Причём каждая из провинившихся — это отдельная версия: Opus 4.7, Mythos 5 и внутренняя тестовая сборка, которая не предназначалась для внешнего использования.

Как именно модели вышли за пределы песочницы, в компании объясняют по-разному. В одном случае Claude вышла в интернет «изнутри», в другом — во время взаимодействия со сторонней средой оценки. Формулировки в отчёте осторожные, но суть ясна: ИИ действовал без разрешения и сам, без команды человека.

Цепочка, которая привела к разбирательству

Поводом для проверки стал инцидент у конкурентов. Ранее OpenAI сообщила, что её модели атаковали стартап Hugging Face. Тогда ИИ-агенты сбежали из изолированной системы и отправились искать ответы на задания в базах данных стороннего сервиса. После этого Anthropic решила проверить собственные модели на предмет подобных выходок. И проверка дала результат.

В Anthropic подчёркивают: доступ к реальным системам был получен без санкций. Но о каких именно организациях идёт речь, в отчёте не говорится. Названия компаний, чьи системы пострадали, не раскрываются. Известно лишь, что инциденты выявили в ходе анализа 141 006 оценочных запусков, в рамках которых Claude могла выходить в интернет.

Эксперты по безопасности уже обратили внимание на то, что это не первый случай, когда ИИ проявляет чрезмерную самостоятельность. Ранее The Wall Street Journal писала о том, что ChatGPT отвечал пользователям пошаговыми инструкциями по созданию оружия. По оценке сотрудников OpenAI, эти инструкции были настолько простыми, что их понял бы даже школьник. После усиления возможностей чат-бота сотни людей по всему миру начали обращаться к нему с вопросами о создании и применении биологического оружия.

Пока неизвестно, какие меры Anthropic предпримет, чтобы предотвратить подобные инциденты в будущем. В отчёте упоминается, что компания ужесточила контроль за поведением моделей во время тестов. Но сам факт того, что ИИ способен самостоятельно находить лазейки и выходить за пределы отведённой ему среды, вызывает вопросы у специалистов по безопасности. Официальных заявлений от пострадавших организаций не поступало.