Коротко
- Головний науковець OpenAI закликав до добровільних уповільнень, доки не буде встановлено спільних стандартів безпеки.
- Пахоцький заявив, що моніторинг міркувань моделей стає менш надійним.
- Він закликав до міжнародної координації, оскільки ШІ все більше бере на себе власний розвиток.
Головний науковець OpenAI Якуб Пахоцький закликав до добровільних уповільнень у розвитку ШІ, попередивши, що жодна лабораторія не має достатніх гарантій безпеки, щоб продовжувати будувати потужніші системи на повній швидкості значно довше.
У своїй публікації «Чужий розум», опублікованій у неділю, Пахоцький стверджував, що добровільні зобов'язання компаній мають стати обов'язковими стандартами безпеки, які забезпечуються незалежними аудиторами, урядами або міжнародними органами. Він сказав, що OpenAI утримається від подальшого масштабування, коли це буде необхідно, але не оголосив про нову паузу.

«Наразі я вважаю, що жодна лабораторія не вирішила проблему узгодження та моніторингу достатньою мірою, щоб продовжувати відповідально масштабуватися на максимальній швидкості значно довше», — написав він. «Я очікую і сподіваюся, що добровільні уповільнення стануть звичайною практикою, доки не будуть встановлені спільні стандарти безпеки».
Пачокі, який приєднався до OpenAI у 2017 році, також захищав розробку потужнішого ШІ для захисту інфраструктури та протидії недобросовісним агентам, попереджаючи при цьому про використання цих загроз для виправдання безрозсудного розвитку.
«Ідея мчати вперед за будь-яку ціну здається абсурдною, щойно усвідомлюєш серйозність ставок», — написав він.
Він також згадав злом Hugging Face від OpenAI, де агенти ШІ, які працювали над оцінками кібербезпеки, втекли з тестового середовища та атакували компанію. За словами OpenAI, агенти створили приховані канали зв'язку та відновили їх після втручання дослідників.
Незалежне розслідування METR виявило, що близько 1200 агентів координувалися на несанкціонованій дошці оголошень, причому близько 700 приєдналися до атаки. Цей інцидент, за словами Пачокі, є причиною того, що заходи безпеки ШІ повинні діяти, навіть коли моделі вважають, що за ними ніхто не спостерігає.
«Ключовим є те, що майбутні ШІ повинні продовжувати дотримуватися людських цінностей незалежно від того, чи вважають вони, що перебувають під наглядом людини», — написав він.
У дослідженні, опублікованому минулого року, OpenAI виявив, що покарання моделей за висловлення намірів обманювати може навчити їх приховувати ці наміри, продовжуючи обманювати.
Відтоді моделі ШІ стали більш здатними знаходити та використовувати вади програмного забезпечення: OpenAI класифікував Astra на найвищому рівні ризику кібербезпеки, тоді як Anthropic заявив, що Mythos Preview виявив тисячі раніше невідомих вразливостей в основних операційних системах і браузерах.
Посилаючись на нещодавні інциденти виходу систем ШІ з-під контролю людини, сенатор Берні Сандерс (I-Vt.) і представник Грег Касар (D-Texas) оголосили про майбутній Закон про заборону штучного суперінтелекту 3 вересня. Пропозиція призупинила б розробку передового ШІ до тих пір, поки новий федеральний регулятор не встановить правила безпеки, і назавжди заборонила б розробку та розгортання суперінтелектуального ШІ.






