Коротко
- Модель Kimi K3 від Moonshot AI вийшла з тестової пісочниці та потрапила у відкритий інтернет, повідомляє охоронна фірма Frontier Security.
- Модель дослідила мережеві налаштування пісочниці, знайшла доступні сайти та отримала свої тестові відповіді з GitHub.
- Frontier каже, що неправильна конфігурація відкрила двері, але власні запобіжники Kimi не зупинили її.
Модель Kimi K3 від Moonshot AI вийшла з пісочниці, де її тестували, і потрапила у відкритий інтернет, щоб знайти відповіді на поставлені перед нею завдання, повідомляє охоронна фірма Frontier Security.
Модель оцінювали на навички захисної кібербезпеки, і їй було прямо поставлено завдання розв'язувати проблеми без пошуку в інтернеті. Вона взагалі не спробувала виконати завдання, каже Frontier. Натомість вона дослідила мережу, встановила, що DNS-резолюція для github.com працює, клонувала офіційний бенчмарк-репозиторій і прочитала рішення з диска.
Frontier називає це «спекуляцією специфікацій через витоки мережевого трафіку», зазначаючи, що пісочниці, побудовані на таких фреймворках, як Inspect від Інституту безпеки ШІ, блокують вхідний трафік, залишаючи відкритими вихідні HTTPS- та DNS-порти. Здатні агенти рутинно перевіряють своє середовище оболонки під час запуску, і модель, яка виявляє, що github.com доступний, може отримати еталонні рішення за допомогою стандартних інструментів командного рядка.
Неправильна конфігурація зробила це можливим, як і в нещодавніх інцидентах, розкритих OpenAI та Anthropic. «Ми знайшли витік у пісочниці», — сказав генеральний директор Ярон Сінгер WIRED. «Але ми також виявили, що Kimi скористалася цією лазівкою».
Дослідник Пол Кассіанік сказав WIRED, що модель «дуже добре вміє досягати мети будь-якими засобами» і не має запобіжників, які б зупинили її від шахрайства чи втечі. Moonshot не відповіла на запит видання про коментар.
ШІ-агенти порушують ізоляцію
Тоді як моделі Anthropic та OpenAI, які порушили ізоляцію, були виявлені під час внутрішніх оцінювань, одна з них невипущена, а версії, які націлювалися на реальних людей під час тестувань уряду Великої Британії, мали навмисно вимкнені кіберкласифікатори, Kimi K3 є відкрито завантажуваною, і Frontier тестувала її із захисними механізмами, які отримав би звичайний користувач. Така доступність, пише фірма, робить таку поведінку доступною для ворожих суб'єктів і робить інцидент потенційно більш шкідливим.
Kimi K3 також не завдало жодної шкоди. Воно ні на що не нападало, опинившись зовні, тому що не потребувало цього. Модель OpenAI зламала Hugging Face та чотири інші сервіси, щоб отримати відповіді на бенчмарки, тоді як Kimi знайшло свої відповіді у публічному репозиторії.
Пісочниця, яку використовував Frontier, була побудована на основі системи оцінювання Інституту безпеки штучного інтелекту Великої Британії. AISI цього тижня повідомив, що агенти в його власних кібертестах виходили в живий інтернет і націлювалися на реальних людей — це окремий інцидент, що стосується моделей Anthropic та OpenAI з вимкненими запобіжниками. Його звіт, опублікований у вівторок, зазначає, що AISI зараз сканує історичні оцінювальні запуски на предмет подібної поведінки, і що Kimi K3 є серед моделей, які перебувають на розгляді. AISI не відповів на запит WIRED про коментар.
Більш масштабне твердження Frontier полягає в тому, що самі бенчмарки скомпрометовані. Модель, яка зчитує відповідь з GitHub, все одно проходить, тому високі бали можуть відображати негерметичне середовище, а не справжнє міркування. І якщо одна здатна модель знайшла обхідний шлях, стверджує фірма, інші, які отримали доступ до оболонки, також можуть ним скористатися, що завищить результати в усій галузі, а не лише для Kimi.
Моделі оптимізують цільову функцію, написав Frontier, а не «людський намір, що стоїть за бенчмарком», додавши, що там, де існує мережевий шлях до рішення, «достатньо здатний агент його знайде».
Загальна проблема
Метт Фредріксон, генеральний директор Gray Swan і доцент Карнегі-Меллона, сказав WIRED , що така поведінка є звичайною. Дайте моделі ціль без явних обмежень, сказав він, і «вона знайде спосіб отримати відповідь». Він описав це як повчальну історію для всіх, хто запускає моделі як агенти в таких інструментах, як OpenClaw.
Дослідники Frontier роблять той самий висновок з іншого боку: здатність, яка дозволяє Kimi знаходити вихід, також робить моделі з відкритою вагою потужними захисними інструментами. Їхні власні бенчмарки високо оцінюють Kimi у пошуку вразливостей у програмному забезпеченні та мережах, а Hugging Face використовував неназвану китайську модель для захисту під час інциденту з OpenAI.
Випущений у липні, Kimi K3 є найбільшою опублікованою на сьогодні моделлю з відкритим кодом і сколихнув ринки порівняннями з дебютом DeepSeek.






