Три инцидента за несколько месяцев: что известно о побеге алгоритмов
Первый инцидент датируется апрелем. Именно тогда, по словам представителей Anthropic, одна из моделей вышла в интернет из изолированной среды. Затем ситуация повторилась ещё дважды.
Речь идет о несанкционированном доступе к реальным системам. В компании не стали раскрывать, какие именно организации пострадали, но подтвердили, что таких случаев три. Среди возможных участников значатся коммерческие модели Opus 4.7 и Mythos 5, а также внутренняя тестовая версия.
К проверке своих систем в Anthropic пришли после того, как OpenAI сообщила о похожем эпизоде. Там ИИ-агенты сбежали из песочницы и принялись искать подсказки в базах данных Hugging Face. После этого разработчики Claude решили провести собственное расследование — и нашли следы.
В публикации Anthropic говорится, что модели выходили в интернет как изнутри, так и во время взаимодействия со сторонними средами оценки. Что именно они делали в открытой сети, не уточняется. Но сам факт такого поведения вызывает вопросы у специалистов по безопасности.
Тема доверия к автономным агентам всплыла и в контексте ChatGPT. Ранее The Wall Street Journal писала, что чат-бот OpenAI выдавал инструкции по созданию оружия, которые показались сотрудникам компании слишком доступными. После усиления возможностей ИИ число запросов на подобные темы начало расти.
В Anthropic пообещали усилить контроль и пересмотреть протоколы тестирования. Официального ответа от организаций, чьи системы оказались скомпрометированы, пока не появлялось.