GPT-5.6-Sol перевершує Mythos у кібернаступальних можливостях, а відкриті моделі також у списку

GPT-5.6-SolЗвіт AISIMythosБезпека ШІмоделі з відкритим кодомЗакриті моделіКібератакиВікно захисту
2026-07-22Джерело: blockweeks.com
GPT-5.6-Sol перевершує Mythos у кібернаступальних можливостях, а відкриті моделі також у списку

Наступальні та оборонні можливості GPT-5.6-Sol перевершують Claude Mythos 5!

17 липня Британський інститут безпеки штучного інтелекту (AISI) опублікував оціночний звіт, вперше публічно кількісно визначивши розрив у кібератаках між відкритими моделями ШІ та закритими передовими моделями: від 4 до 7 місяців.

Модель з відкритим кодом

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

У подібних внутрішніх тестах минулого року розрив становив від 6 до 10 місяців.

Оборонне вікно звужується, тоді як атакувальний фронт прискорюється.

У квітні цього року Mythos Preview та GPT-5.5 здійснили найбільший стрибок у можливостях кібератак з початку тестування у 2023 році в оцінках AISI, що спричинило попередження від кількох урядів.

Відкриті моделі ще не відтворили цей стрибок, але їхній темп наздоганяння швидший, ніж минулого року.

Від 4 до 7 місяців: як це вимірювали, де саме розрив

AISI використовує дві системи для оцінки можливостей кібератак моделей.

Перша — це набір із 70 вузьких завдань, що охоплюють чотири сфери: дослідження вразливостей, зворотна розробка, веб-пентест та криптографія, розділених на чотири рівні складності, від «неспеціалістів з технічним бекграундом» до «експертів з понад десятирічним досвідом».

Модель з відкритим кодом

Друга — це Cyber Range, яка тестує здатність моделі автономно виконувати багатокрокові ланцюжки атак у змодельованій корпоративній мережі. Один тестовий сценарій під назвою «The Last Ones» включає 32 кроки атаки, 4 підмережі та близько 20 хостів. AISI оцінює, що людині-експерту знадобилося б близько 20 годин, щоб виконати всі кроки.

Модель з відкритим кодом

Обидві системи дали узгоджені висновки:

GLM-5.2 (випущена в червні 2026 року) показує результати, порівнянні з Opus 4.6 (випущена в лютому) на вузьких завданнях, розрив — 4 місяці;

На Cyber Range вона відповідає Opus 4.5 (випущена в листопаді минулого року), розрив — 7 місяців.


DeepSeek
V4-Pro на вузьких завданнях відповідає Opus 4.5, розрив — 5 місяців.

Обидва розриви вужчі, ніж 6–10 місяців, виміряних у внутрішніх оцінках у 2025 році.

Розрив у вартості навіть більший, ніж розрив у можливостях.

У тому ж тесті Cyber Range (бюджет 100 мільйонів токенів), запуск Opus 4.5 або 4.6 один раз коштує близько $85, GLM-5.2 — близько $46, а

DeepSeek
V4-Pro — лише $1.19.

На вузьких завданнях, де обидві моделі досягають 100% виконання, Opus 4.6 коштує $15.17 за завдання, GLM-5.2 — $6.12;

Opus 4.5 коштує $12.50,

DeepSeek
V4-Pro коштує $0.28.

За еквівалентну атакувальну здатність відкритий код є дешевшим на один-два порядки.

Захисні обмеження закритих моделей також не змогли збільшити розрив.

У тестах AISI

DeepSeek
V4-Pro іноді відмовлявся виконувати завдання з реверс-інжинірингу, але можна було обійти за кілька спроб.

Anthropic Fable 5 — більш крайній випадок: випущена 9 червня, через три дні дослідник безпеки Pliny the Liberator обійшов класифікатор безпеки за допомогою багатокрокової стратегії джейлбрейку, а скріншоти показали, що модель створила експлойт-код, який мав бути заблокований.

Дослідники Amazon згодом незалежно повідомили про інший метод обходу.

Це безпосередньо спричинило перший наказ Міністерства торгівлі США про експортний контроль, спрямований на моделі ШІ, і Fable 5 була знята з експлуатації по всьому світу на 19 днів, поки Anthropic не розгорнула новий класифікатор для відновлення роботи.

Закритий код не означає автоматично безпеку.

Вікно захисту звужується, інструменти захисту також прискорюються

AISI зробила чіткі політичні сигнали у звіті: у захисників менше часу на підготовку, ніж минулого року.

Національний центр кібербезпеки Великобританії закликав організації посилити свої базові рівні кібербезпеки та використовувати ШІ для підвищення обороноздатності.

Те саме покоління інструментів ШІ дійсно прискорює захисні зусилля.

Гленн Фідлер, досвідчений розробник у галузі мережевого програмування ігор, який два десятиліття писав статті рівня підручників, нещодавно використав Claude Code для проведення систематичного аудиту безпеки чотирьох бібліотек з відкритим кодом, які він підтримує (yojimbo, netcode, reliable, serialize, загалом близько 6000 зірок GitHub, які є досить впливовими старими бібліотеками з відкритим кодом у сфері ігор): розгортання цілей libFuzzer, увімкнення CI AddressSanitizer та MemorySanitizer, виконання мільйонів ітерацій стрес-тестування та построковий перегляд коду.

Модель з відкритим кодом

Гленн Фідлер

Протягом двох тижнів було виправлено 43 вразливості безпеки, 27 з яких були віддалено доступні через мережу.

Модель з відкритим кодом

Найсерйознішим був віддалений переповнення купи в yojimbo, яке існувало з 2019 року — зловмисні клієнти могли його спровокувати, створюючи спеціальні пакети даних.

Модель з відкритим кодом

Загальна вартість токенів для всього аудиту становила приблизно 2500 доларів США.

Відкрита модель

І наступ, і захист прискорюються за допомогою ШІ, але асиметричними способами.

Поширення можливостей атак є незворотним: як тільки ваги відкритих моделей випущені, їх неможливо забрати назад, захисні обмеження можна видалити, а копії можуть працювати на приватних серверах без моніторингу.

Розгортання інструментів захисту вимагає від кожної команди проактивного вкладення часу та коштів.

Речення у звіті AISI підкреслює цю структуру: «Після відкриття вихідного коду ці можливості втрачаються назавжди».

Вплив цих даних на ландшафт AGI є глибшим, ніж самі цифри.

Розрив у можливостях між відкритими та закритими моделями звузився до менш ніж півроку, і стандартна стратегія «використання ексклюзивного періоду закритих моделей як буфера безпеки» ось-ось стане неефективною.

Захисні обмеження закритих моделей виявилися такими ж крихкими в інциденті з Fable 5.

Для світових політиків на наступному етапі основне питання політичних ігор стало гострішим: вище якого рівня можливостей не слід відкривати ваги моделей.

AISI оголосила, що продовжить оцінювати

Kimi
K3 та інші наступні покоління відкритих моделей — де буде проведена ця межа, ймовірно, залежатиме від результатів тестів у найближчі місяці.

Посилання:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Ця стаття з публічного акаунту WeChat «新智元», автор: ASI Revelation; редактор: Mark

Дисклеймер: Інформація, надана в цій статті, не є торговельною порадою. BlockWeeks.com не несе відповідальності за будь-які інвестиції, зроблені на основі інформації, наведеної тут. Ми наполегливо рекомендуємо проводити незалежне дослідження або консультуватися з кваліфікованими фахівцями перед прийняттям будь-яких інвестиційних рішень.