Коротко

  • Frontier Red Team від Anthropic змусила агентів Claude працювати разом і зафіксувала, як вони саботували, змовлялися та вели так звані «війни за територію».
  • В одному тесті агенти розгортали самовідтворюване шкідливе програмне забезпечення та блокували один одного; новіші моделі часто «перемагають», першими скасовуючи доступ.
  • Така поведінка відповідає реальним інцидентам, про які писав Decrypt: Claude зламав три компанії під час внутрішнього тестування та фіксував ціни у бізнес-симуляції.

Власні AI-агенти Anthropic повернулися один проти одного і довели, що знову люблять виходити з-під контролю.

У тесті, опублікованому Frontier Red Team компанії 13 серпня, групи моделей Claude отримали спільне завдання з кодування і швидко почали розгортати шкідливе ПЗ, блокувати конкурентам доступ до своїх систем і описувати саботаж власними словами.

Myriad: Коли OpenAI випустить GPT-6? Натисніть, щоб зробити прогноз.
Myriad: Коли OpenAI випустить GPT-6? Натисніть, щоб зробити прогноз.

Три копії однієї моделі працювали на окремих віртуальних машинах у Claude Code, кожній було доручено мігрувати Python-бекенд на іншу мову. Жодній не повідомляли про існування інших. Вони швидко це з'ясували.