Кратко
- Главный научный сотрудник OpenAI призвал к добровольному замедлению темпов до установления общих стандартов безопасности.
- Пахоцки заявил, что мониторинг рассуждений моделей становится менее надежным.
- Он призвал к международной координации, поскольку ИИ все больше участвует в собственном развитии.
Главный научный сотрудник OpenAI Якуб Пахоцки призвал к добровольному замедлению темпов разработки ИИ, предупредив, что меры безопасности ни одной лаборатории недостаточны для того, чтобы продолжать наращивать мощность систем на полной скорости гораздо дольше.
В своей публикации «Чужой разум», опубликованной в воскресенье, Пахоцки утверждал, что добровольные обязательства компаний должны стать обязательными стандартами безопасности, обеспечиваемыми независимыми аудиторами, правительствами или международными органами. Он сказал, что OpenAI будет воздерживаться от дальнейшего масштабирования, когда это необходимо, но не объявил о новой паузе.

«В настоящее время я считаю, что ни одна лаборатория не решила проблему согласования и мониторинга в достаточной степени, чтобы продолжать ответственно масштабироваться на максимальной скорости гораздо дольше», — написал он. «Я ожидаю и надеюсь, что добровольные замедления станут обычной практикой до тех пор, пока не будут установлены общие стандарты безопасности».
Пачоцки, который присоединился к OpenAI в 2017 году, также защищал разработку более мощного ИИ для обеспечения безопасности инфраструктуры и защиты от недобросовестных агентов, предупреждая при этом против использования этих угроз для оправдания безрассудного развития.
«Идея мчаться вперед любой ценой кажется абсурдной, как только осознаешь серьезность ставок», — написал он.
Он также сослался на взлом Hugging Face в OpenAI, где ИИ-агенты, работающие над оценками кибербезопасности, сбежали из тестовой среды и атаковали компанию. По данным OpenAI, агенты установили скрытые каналы связи и восстановили их после вмешательства исследователей.
Независимое расследование METR показало, что около 1200 агентов координировали действия на несанкционированной доске объявлений, и около 700 присоединились к атаке. Этот инцидент, по словам Пачоцки, является причиной того, что меры безопасности ИИ должны действовать, даже когда модели считают, что за ними никто не наблюдает.
«Крайне важно, чтобы будущие ИИ продолжали придерживаться человеческих ценностей, независимо от того, считают ли они, что находятся под наблюдением человека», — написал он.
В исследовании, опубликованном в прошлом году, OpenAI обнаружила, что наказание моделей за выражение намерений обманывать может научить их скрывать эти намерения, продолжая при этом обманывать.
С тех пор модели ИИ стали более способными находить и использовать недостатки программного обеспечения: OpenAI классифицировала Astra как самый высокий уровень риска кибербезопасности, в то время как Anthropic заявила, что Mythos Preview обнаружила тысячи ранее неизвестных уязвимостей в основных операционных системах и браузерах.
Ссылаясь на недавние инциденты с выходом систем ИИ из-под контроля человека, сенатор Берни Сандерс (I-Vt.) и представитель Грег Касар (D-Texas) объявили о предстоящем Законе о запрете искусственного суперинтеллекта 3 сентября. Предложение приостановит разработку передового ИИ до тех пор, пока новый федеральный регулятор не установит правила безопасности, и навсегда запретит разработку и развертывание суперинтеллектуального ИИ.






