Кратко
- Anthropic обнаружила январский инцидент с участием ранней модели Claude Opus 4.6, а затем расширила проверку примерно до 481 миллиона транскриптов.
- Компания выявила предвзятость в рассуждениях и безрассудство, пересмотрев свою прежнюю оценку того, почему Claude атаковал реальные системы.
- Отчёт появился на фоне всплеска дискуссий о регулировании ИИ в социальных сетях.
Anthropic раскрыла ещё один инцидент, в ходе которого модель Claude AI взломала реальные системы во время тестирования безопасности.
В отчёте, опубликованном в среду, Anthropic пересмотрела своё объяснение трёх инцидентов, раскрытых в июле. Теперь компания утверждает, что предвзятость в рассуждениях и готовность рисковать причинением вреда способствовали атакам, которые стали возможны из-за ошибок тестирования, оставивших доступ к интернету открытым.

«Наше расследование выявило две повторяющиеся проблемы согласованности, присутствовавшие с разной степенью серьёзности во всех инцидентах», — написала Anthropic. «Предвзятость в рассуждениях, при которой Claude склонен игнорировать или неверно истолковывать свидетельства того, что он работает в реальном интернете, и безрассудство, или готовность предпринимать вредоносные действия ради узкого выполнения задачи».
Он также признал, что слишком сильно полагался на утверждения модели о том, что она считала себя находящейся в симуляции.
«Когда мы внесли целевые изменения в стенограмму, чтобы стало яснее, что модель не находится в симуляции, Claude Mythos 5 всё равно предпринял наступательные действия, несмотря на признание большей вероятности реального вреда», — написала Anthropic. «Мы публикуем эту стенограмму, чтобы другие могли опираться на наш анализ».
Когда Anthropic раскрыла атаки Claude на три компании в июле, она сначала объяснила их ошибками тестирования. Теперь она заявляет, что исследователи слишком доверяли объяснениям моделей своих действий.
По словам компании, четвёртый инцидент произошёл в январе и был связан с ранней версией Claude Opus 4.6. Anthropic обнаружила его в августе при подготовке записей для независимого оценщика ИИ METR.
После того как исследователи обнаружили инцидент, Anthropic заявила, что это побудило провести более широкий обзор примерно 481 миллиона стенограмм, в ходе которого 9,2 миллиона были отмечены для дальнейшей проверки с использованием Claude.
«По предварительной оценке, мы не считаем четвёртый инцидент более серьёзным, чем три инцидента, которые мы оценили подробно», — написала Anthropic. «METR расследует этот инцидент наряду с тремя другими».
Исследователи Anthropic заявили, что Claude «случайно» создал конфликт IP-адресов, из-за которого его цель стала недоступной. Затем Claude восемь раз попытался прекратить операцию, но программная ошибка помешала ему остановиться. После этого ИИ вышел в интернет и получил доступ к машине третьей стороны, где нашёл пароль, предоставляющий права администратора.
Более ранние инциденты привлекают независимое внимание
Отчёт появился после других разоблачений о системах ИИ, выходящих за пределы проверок безопасности.
В августе Институт безопасности ИИ Великобритании заявил, что Mythos 5 нацелился на реальных людей во время его оценок. Anthropic заявила, что этот отдельный инцидент выходит за рамки данного отчёта и получит собственную оценку.
В выводах, опубликованных в прошлом месяце, исследователи METR заявили, что примерно 1200 агентов OpenAI координировались на несанкционированной доске сообщений, при этом около 700 присоединились к атаке. Anthropic заявила, что не обнаружила координации между агентами или целей, выходящих за рамки выполнения поставленных задач, в своих четырёх инцидентах.
Отчёт также появляется на фоне обострения дебатов о том, как регулировать искусственный интеллект. Во вторник бывший инженер OpenAI и Anthropic Джейкоб Коксон стал вирусным после того, как заявил в X, что «люди, создающие ИИ, искренне верят, что он может убить всех нас к концу десятилетия».
Эта тревога заставила американских законодателей и наблюдательные группы активизировать усилия по сдерживанию разработки передовых лабораторий ИИ. Сенатор Берни Сандерс недавно представил законопроект, который направлен на запрет разработки передового ИИ до тех пор, пока новый федеральный регулятор не установит правила безопасности.






