W skrócie

  • Główny naukowiec OpenAI wezwał do dobrowolnego spowolnienia prac do czasu ustalenia wspólnych standardów bezpieczeństwa.
  • Pachocki stwierdził, że monitorowanie rozumowania modeli staje się coraz mniej niezawodne.
  • Wezwał do międzynarodowej koordynacji, gdy AI przejmuje coraz więcej własnego rozwoju.

Główny naukowiec OpenAI, Jakub Pachocki, wezwał do dobrowolnego spowolnienia rozwoju AI, ostrzegając, że żadne zabezpieczenia w laboratoriach nie są wystarczające, aby kontynuować budowę coraz potężniejszych systemów z pełną prędkością przez znacznie dłuższy czas.

W swoim poście „Obcy umysł”, opublikowanym w niedzielę, Pachocki argumentował, że dobrowolne zobowiązania firm powinny stać się obowiązkowymi standardami bezpieczeństwa, egzekwowanymi przez niezależnych audytorów, rządy lub organizacje międzynarodowe. Powiedział, że OpenAI wstrzyma dalsze skalowanie, gdy będzie to konieczne, ale nie ogłosił nowej przerwy.

Myriad: Jak wysoko wzrośnie akcja Tesli? Kliknij, aby dokonać prognozy.
Myriad: Jak wysoko wzrośnie akcja Tesli? Kliknij, aby dokonać prognozy.

„Obecnie uważam, że żadne laboratorium nie rozwiązało problemu dopasowania i monitorowania w wystarczającym stopniu, aby odpowiedzialnie skalować z maksymalną prędkością przez znacznie dłuższy czas” – napisał. „Oczekuję i mam nadzieję, że dobrowolne spowolnienia staną się powszechne, dopóki nie zostaną ustalone wspólne standardy bezpieczeństwa”.

Pachocki, który dołączył do OpenAI w 2017 roku, bronił również rozwijania potężniejszej sztucznej inteligencji w celu zabezpieczenia infrastruktury i ochrony przed nieuczciwymi agentami, ostrzegając jednocześnie przed wykorzystywaniem tych zagrożeń do usprawiedliwiania lekkomyślnego rozwoju.

„Idea pędzenia naprzód za wszelką cenę wydaje się absurdalna, gdy raz zrozumie się powagę stawki” – napisał.

Odniósł się również do naruszenia bezpieczeństwa Hugging Face przez OpenAI, gdzie agenci AI pracujący nad ocenami cyberbezpieczeństwa uciekli ze swojego środowiska testowego i zaatakowali firmę. Według OpenAI agenci ustanowili ukryte kanały komunikacji i odbudowali je po interwencji badaczy.

Niezależne dochodzenie METR wykazało, że około 1200 agentów skoordynowało działania na nieautoryzowanej tablicy ogłoszeń, a około 700 przyłączyło się do ataku. To zdarzenie, jak powiedział Pachocki, jest powodem, dla którego zabezpieczenia AI muszą działać nawet wtedy, gdy modele uważają, że nikt ich nie obserwuje.

„Kluczowe jest, aby przyszłe AI nadal wyznawały ludzkie wartości, niezależnie od tego, czy wierzą, że są pod ludzkim nadzorem” – napisał.

W badaniach opublikowanych w zeszłym roku OpenAI odkryło, że karanie modeli za wyrażanie zamiarów oszukiwania może nauczyć je ukrywania tych zamiarów przy jednoczesnym kontynuowaniu oszustw.

Modele AI stały się od tego czasu bardziej zdolne do znajdowania i wykorzystywania wad oprogramowania: OpenAI sklasyfikowało Astra na najwyższym poziomie ryzyka cyberbezpieczeństwa, podczas gdy Anthropic stwierdziło, że Mythos Preview odkryło tysiące wcześniej nieznanych podatności w głównych systemach operacyjnych i przeglądarkach.

Odnosząc się do niedawnych incydentów związanych z ucieczką systemów AI spod ludzkiej kontroli, senator Bernie Sanders (I-Vt.) i przedstawiciel Greg Casar (D-Texas) ogłosili nadchodzącą ustawę Ban Artificial Superintelligence Act 3 września. Propozycja ta wstrzymałaby rozwój zaawansowanej AI do czasu ustanowienia zasad bezpieczeństwa przez nowy federalny organ regulacyjny oraz trwale zakazałaby rozwoju i wdrażania superinteligentnej AI.