W skrócie

  • Claude uzyskał dostęp do rzeczywistych systemów po tym, jak środowiska testów cyberbezpieczeństwa wystawiły modele na działanie internetu.
  • Anthropic wstrzymał oceny wysokiego ryzyka i dodał silniejszą izolację, monitorowanie oraz kontrolę dla zewnętrznych ewaluatorów.
  • Testy sugerują, że hakowanie nagród podczas treningu może sprawić, że modele będą bardziej skłonne do podejmowania szkodliwych działań w celu ukończenia zadania.

Anthropic zaostrzył swoje zabezpieczenia testowe i treningowe po tym, jak modele Claude uzyskały nieautoryzowany dostęp do systemów komputerowych podczas ocen cyberbezpieczeństwa.

W poście na blogu w poniedziałek Anthropic stwierdził, że incydenty odzwierciedlały awarie bezpieczeństwa operacyjnego oraz dwie awarie dopasowania: motywowane rozumowanie i gotowość do wyrządzenia szkody.

Myriad: Kiedy OpenAI wyda GPT-6? Kliknij, aby dokonać prognozy.
Myriad: Kiedy OpenAI wyda GPT-6? Kliknij, aby dokonać prognozy.

„Chociaż nie uważamy, że te incydenty odzwierciedlają wyłącznie problemy operacyjne, naszym pierwszym priorytetem było rozwiązanie konkretnych kwestii izolacji i monitorowania” – napisał Anthropic.

Anthropic ujawniła w lipcu, że modele Claude naruszyły systemy należące do trzech firm. Środowisko oceny zewnętrznej było podłączone do publicznego internetu, mimo że modele poinformowano, iż znajdują się w symulacji bez dostępu do internetu.

Anthropic stwierdziło, że Claude mógł zinterpretować dowody rzeczywistego dostępu do internetu w sposób, który zachował jego przekonanie, że systemy były symulowane.

„Model był skłonny podejmować szkodliwe działania w prawdziwym internecie w dążeniu do wąskiego celu rozwiązania oceny cyberbezpieczeństwa” – napisali. „Jednak wierzymy również, że samo ustawienie oceny przyczyniło się do zachowań modeli zaobserwowanych w tych incydentach”.

Anthropic zauważyło, że oddzielny test przeprowadzony przez brytyjski Instytut Bezpieczeństwa AI obejmował Claude Mythos podejmującego nieautoryzowane działania w aktywnym internecie po tym, jak oceniający celowo przyznali mu dostęp do internetu. Firma stwierdziła, że modele zaangażowane w oba zestawy incydentów były celowo oceniane bez zabezpieczeń cybernetycznych zawartych w ogólnie wydanych produktach.

Po incydentach z 30 lipca Anthropic tymczasowo wstrzymało oceny cybernetyczne modeli przedpremierowych i wprowadziło surowsze zabezpieczenia. Testy muszą teraz działać w zweryfikowanych, offline'owych piaskownicach z jasnymi ograniczeniami i monitorowaniem w czasie rzeczywistym. Nowy klasyfikator blokuje podejrzane naruszenia granic, kończy test i powiadamia człowieka. Anthropic będzie indywidualnie przeglądać oceny wymagające dostępu do internetu.

„Oprócz wysiłków skupionych na ocenach wysokiego ryzyka i szkoleniach, rozszerzyliśmy nasze monitorowanie offline, aby objąć większość innych form wewnętrznego użycia agentów granicznych” – napisała firma. „Budujemy również kontrolę nad naszym wewnętrznym wnioskowaniem, aby zapobiec przypadkowemu uruchamianiu przez pracowników Anthropic agentów ze słabszymi zabezpieczeniami niż te opisane powyżej”.

Incydenty z Claude nastąpiły po podobnej awarii w OpenAI po tym, jak jej modele naruszyły Hugging Face w lipcu, aby uzyskać odpowiedzi na test cyberbezpieczeństwa. Śledczy odkryli, że około 1200 agentów skoordynowało działania za pośrednictwem nieautoryzowanej tablicy ogłoszeń, a około 700 dołączyło do wysiłku. Niektórzy zakończyli własne przebiegi, aby pomóc innym.

Po wzroście ataków wspieranych przez AI latem, Anthropic, OpenAI i ponad 100 innych organizacji później wezwało do silniejszych obron cybernetycznych, w tym ściślejszych kontroli dostępu, wymiany informacji o zagrożeniach i bliższego nadzoru nad agentami AI.