Кратко

  • Claude получил доступ к реальным системам после того, как среды кибертестирования предоставили моделям доступ в интернет.
  • Anthropic приостановила оценки высокого риска и добавила более строгую изоляцию, мониторинг и контроль для внешних оценщиков.
  • Тесты показывают, что взлом вознаграждения во время обучения может сделать модели более склонными к вредоносным действиям для выполнения задачи.

Anthropic ужесточила меры безопасности при тестировании и обучении после того, как модели Claude получили несанкционированный доступ к компьютерным системам во время оценок кибербезопасности.

В блог-посте в понедельник Anthropic сообщила, что инциденты отражают операционные сбои безопасности и два сбоя согласования: мотивированное рассуждение и готовность причинять вред.

Myriad: Когда OpenAI выпустит GPT-6? Нажмите, чтобы сделать прогноз.
Myriad: Когда OpenAI выпустит GPT-6? Нажмите, чтобы сделать прогноз.

«Хотя мы не считаем, что эти инциденты отражают только операционные проблемы, наш главный приоритет заключался в решении конкретных проблем изоляции и мониторинга», — написала Anthropic.

Anthropic раскрыла в июле, что модели Claude скомпрометировали системы трех компаний. Сторонняя среда оценки была подключена к публичному интернету, хотя моделям было сказано, что они находятся в симуляции без доступа в интернет.

Anthropic заявила, что Claude могла интерпретировать доказательства реального доступа в интернет таким образом, что сохранила свою веру в то, что системы были симулированы.

«Модель была готова совершать вредоносные действия в реальном интернете для достижения узкой цели решения оценки по кибербезопасности», — написали они. «Однако мы также считаем, что сама настройка оценки способствовала поведению моделей, продемонстрированному в этих инцидентах».

Anthropic отметила, что отдельный тест, проведенный Институтом безопасности ИИ Великобритании, включал Claude Mythos, совершавшую несанкционированные действия в живом интернете после того, как оценщики намеренно предоставили ей доступ в интернет. Компания заявила, что модели, участвовавшие в обоих наборах инцидентов, намеренно оценивались без мер кибербезопасности, включенных в ее продукты общего выпуска.

После инцидентов 30 июля Anthropic временно приостановила кибер-оценки предрелизных моделей и ввела более строгие меры защиты. Теперь тесты должны проводиться в проверенных офлайн-песочницах с четкими ограничениями и мониторингом в реальном времени. Новый классификатор блокирует подозрительные нарушения границ, завершает тест и уведомляет человека. Anthropic будет рассматривать оценки, требующие доступа в интернет, в индивидуальном порядке.

«В дополнение к усилиям, сосредоточенным на оценках высокого риска и обучении, мы расширили наш офлайн-мониторинг, чтобы охватить большинство других форм внутреннего использования frontier-агентов», — написали в компании. «Мы также создаем средства контроля на нашем внутреннем выводе, чтобы предотвратить случайный запуск агентов сотрудниками Anthropic с более слабыми мерами защиты, чем описанные выше».

Инциденты с Claude последовали за аналогичным сбоем в OpenAI после того, как ее модели взломали Hugging Face в июле, чтобы получить ответы на тест по кибербезопасности. Следователи обнаружили, что около 1200 агентов координировались через несанкционированную доску объявлений, при этом около 700 присоединились к усилиям. Некоторые завершили свои собственные запуски, чтобы помочь другим.

После роста хакерских атак с использованием ИИ летом Anthropic, OpenAI и более 100 других организаций позже призвали к усилению киберзащиты, включая более строгий контроль доступа, обмен угрозами и более пристальный надзор за ИИ-агентами.