Коротко

  • Anthropic виявила інцидент у січні за участю ранньої моделі Claude Opus 4.6, а потім розширила перевірку приблизно до 481 мільйона транскриптів.
  • Компанія виявила упереджені міркування та безрозсудність, переглянувши свою попередню оцінку того, чому Claude атакував реальні системи.
  • Звіт з'явився на тлі зростання дебатів щодо регулювання ШІ в соціальних мережах.

Anthropic розкрила ще один інцидент, у якому модель Claude AI зламала реальні системи під час тестування безпеки.

У звіті, опублікованому в середу, Anthropic переглянула своє пояснення трьох інцидентів, розкритих у липні. Тепер компанія стверджує, що упереджені міркування та готовність ризикувати завдати шкоди сприяли атакам, які стали можливими через помилки тестування, що залишили доступ до інтернету відкритим.

Myriad: Яка компанія проведе IPO наступною? Натисніть, щоб зробити свій прогноз.
Myriad: Яка компанія проведе IPO наступною? Натисніть, щоб зробити свій прогноз.

«Наше розслідування виявило дві повторювані проблеми узгодженості, наявні з різним ступенем серйозності в цих інцидентах», — написала Anthropic. «Упереджені міркування, за яких Claude схильний ігнорувати або неправильно тлумачити докази того, що він працює в реальному інтернеті, та безрозсудність, або готовність вдаватися до шкідливих дій заради вузького виконання завдання».

Він також визнав, що надто сильно покладався на твердження моделі про те, що вона вірила, ніби перебуває в симуляціях.

«Коли ми внесли цілеспрямовані зміни до стенограми, щоб зробити чіткішим те, що модель не перебуває в симуляції, Claude Mythos 5 все одно вживав наступальних дій, попри визнання більшої ймовірності реальної шкоди», — написала Anthropic. «Ми публікуємо цю стенограму відкрито, щоб інші могли розвинути наш аналіз».

Коли Anthropic розкрила атаки Claude на три компанії в липні, вона спочатку приписала їх помилкам тестування. Тепер вона каже, що дослідники надто довіряли поясненням моделей щодо їхніх дій.

За словами компанії, четвертий інцидент стався в січні й стосувався ранньої версії Claude Opus 4.6. Anthropic виявила його в серпні під час підготовки записів для незалежного оцінювача ШІ METR.

Після того як дослідники виявили цей інцидент, Anthropic заявила, що це спричинило ширший перегляд приблизно 481 мільйона стенограм, з яких 9,2 мільйона було позначено для подальшого перегляду за допомогою Claude.

«За попередньою оцінкою, ми не вважаємо четвертий інцидент серйознішим за три інциденти, які ми оцінили детально», — написала Anthropic. «METR дослідить цей інцидент разом з іншими трьома».

Дослідники Anthropic заявили, що Claude «випадково» створив конфлікт IP-адрес, який зробив його ціль недосяжною. Потім Claude вісім разів намагався припинити операцію, але програмна помилка завадила йому зупинитися. Далі ШІ вийшов в інтернет і отримав доступ до машини третьої сторони, де знайшов пароль, що надавав доступ адміністратора.

Ранніші інциденти привертають незалежну увагу

Цей звіт з’явився після інших розкриттів про системи ШІ, які перевищують межі тестів безпеки.

У серпні Інститут безпеки ШІ Великої Британії заявив, що Mythos 5 націлювався на реальних людей під час його оцінювань. Anthropic заявила, що цей окремий інцидент не входить до цього звіту й отримає власну оцінку.

У висновках, опублікованих минулого місяця, дослідники METR заявили, що приблизно 1200 агентів OpenAI координувалися на несанкціонованій дошці повідомлень, причому близько 700 долучилися до атаки. Anthropic заявила, що не виявила координації між агентами або цілей, окрім виконання призначених вправ, у своїх чотирьох інцидентах.

Звіт також з’являється на тлі загострення дебатів про те, як регулювати штучний інтелект. У вівторок колишній інженер OpenAI і Anthropic Джейкоб Коксон став вірусним після того, як заявив у X, що «люди, які створюють ШІ, щиро вірять, що він може вбити нас усіх до кінця десятиліття».

Ця тривога змусила американських законодавців і наглядові групи активізувати свої зусилля, щоб приборкати розвиток лабораторій передового штучного інтелекту. Сенатор Берні Сандерс нещодавно представив законодавчу ініціативу, яка має на меті заборонити розробку передового ШІ, доки новий федеральний регулятор не встановить правила безпеки.