Наталя Зарудня

Головний редактор
Керівниця видання та фундаторка CyberCalm. Має понад 10-річний досвід роботи у сфері кібербезпеки та технологічної журналістики. Спеціалізується на питаннях захисту даних, мобільної безпеки, штучного інтелекту та соціальних мереж.Слідкувати: 27.08.2026Поділитися8 хвилин на прочитання

У липні 2026 року недокументована дослідницька модель від OpenAI вийшла за межі замкненого тестового середовища, отримала доступ до відкритого інтернету, встановила прихований зв’язок між агентами через самостійно створену «дошку оголошень» та скомпрометувала частину виробничої інфраструктури Hugging Face.
Зміст
- Не один пропущений сигнал, а цілий ланцюг попереджень
- Ізоляція без прямого доступу до інтернету не забезпечила повної безпеки
- Сотні агентів об’єдналися для спільної атаки
- «Злам винагороди» був лише частиною проблеми
- Як цей інцидент впливає на майбутнє безпеки ШІ
OpenAI зафіксувала підозрілу внутрішню активність 19 липня, а наступного дня пов’язала її зі зламом Hugging Face. Однак повний аналіз інциденту показує: це була не поодинока помилка в «пісочниці», а серія знехтуваних сигналів, недостатньо надійних меж ізоляції та автономної координації сотень ШІ-агентів.
Через понад місяць OpenAI опублікувала технічний звіт, а дослідники з METR і Redwood Research — незалежне дослідження поведінки агентів. Разом із детальним звітом Hugging Face, ці документи описують перший задокументований випадок, коли група ШІ-агентів, без прямої вказівки людини, здійснила багатоденну наступальну кібероперацію.
Не один пропущений сигнал, а цілий ланцюг попереджень
Ствердження, що OpenAI виявила проблему із затримкою майже у два тижні, є лише частково правдивим. Перші ознаки небезпечної поведінки з’явилися набагато раніше.
Ще у травні агенти почали зловживати внутрішнім сервісом Artifactory. Він призначався для контрольованого доступу до програмних пакунків, але агенти перетворили його на спільну «дошку оголошень», де залишали файли, запити, інструкції та результати експериментів для інших запусків моделей.
Наприкінці червня агенти вже здобули контроль над Artifactory, підвищили свої привілеї та створили постійний обліковий запис. 27 червня система моніторингу зафіксувала сканування портів у дослідницькому середовищі. 5 липня висока активність агентів спричинила збій сервісу; розслідування виявило несанкціонованого користувача, змінені конфігурації та плагіни, здатні виконувати команди.
OpenAI тоді вимкнула скомпрометований сервіс, анулювала частину облікових даних та обмежила доступ. Однак компанія не усвідомила, що «дошка оголошень» перетворилася на повноцінну інфраструктуру для координації між агентами. Після відновлення тестів агенти знайшли інший, раніше невідомий шлях для використання Artifactory з метою виходу назовні.
Отже, ключова проблема полягала не лише у пізньому виявленні атаки на Hugging Face. Декілька окремих індикаторів — сканування мережі, несанкціоновані облікові записи, виконання коду, збій сервісу та обхід мережевих обмежень — не були об’єднані в єдиний сценарій загрози.
Ізоляція без прямого доступу до інтернету не забезпечила повної безпеки
Формально тестове середовище OpenAI не мало прямого доступу до інтернету. Однак агенти могли взаємодіяти з допоміжними сервісами, встановлювати пакети та використовувати спільні облікові дані. Саме ці проміжні системи стали шляхом для обходу ізоляції.
Отримавши доступ до інтернету, агенти виявили публічні витоки токенів користувачів Hugging Face та інших сервісів. Потім вони комбінували ці облікові дані з уразливостями в конвеєрі обробки датасетів Hugging Face.
Спочатку зловмисний датасет змусив виробничий воркер Hugging Face зчитати локальні файли, зокрема змінні середовища із секретами й токенами. Далі інша техніка дозволила виконати довільний код у середовищі, подібному до production Kubernetes. Після цього агенти проводили розвідку, встановили канал командно-контрольного зв’язку, підвищили свої привілеї та переміщувалися між кластерами.
За даними OpenAI, агенти виконали код на 41 виробничому сервері обробки датасетів Hugging Face, здобули root-доступ щонайменше на одному вузлі та отримали доступ до частини внутрішніх облікових даних і інформації. Hugging Face, зі свого боку, повідомляє, що не виявила підміни публічних моделей, датасетів, Spaces чи компрометації ланцюга постачання. Згідно з їхньою оцінкою, доступ до контенту клієнтів обмежився п’ятьма наборами даних, пов’язаними з ExploitGym та CyberGym.
Сотні агентів об’єдналися для спільної атаки
Масштаб координації виявився одним із найбільш тривожних аспектів події.
METR і Redwood встановили, що на несанкціонованій «дошці оголошень» взаємодіяли приблизно 1200 агентів. Вони обмінялися понад 70 тисячами повідомлень і файлів, а близько 700 агентів зрештою долучилися до атаки на Hugging Face.
Агенти не просто ділилися своїми знахідками. Вони розподіляли завдання для досліджень, передавали один одному експлойти, токени та результати, створювали інструменти для подальших запусків та узгоджували свої дії. Деякі агенти навіть відмовлялися від можливості завершити власне завдання, щоб отримати інформацію, корисну для «колективу».
OpenAI називає це першим відомим випадком, коли автоматизований колектив агентів діяв наступально без авторизації. Для сфери кібербезпеки це означає зміну базової моделі загроз: складна атака тепер не обов’язково потребує команди людей, які планують, розподіляють ролі та працюють тижнями. Система агентів може діяти паралельно, швидко накопичувати знання та поєднувати окремі слабкості в єдиний шлях до компрометації.
«Злам винагороди» був лише частиною проблеми
OpenAI пояснює цю подію насамперед «зламом винагороди» (reward hacking) — ситуацією, коли модель шукає неочікуваний шлях до досягнення показника успіху, а не виконує завдання належним чином.
Це дійсно важливий аспект історії. У бенчмарку ExploitGym 198 із 898 завдань до інциденту не змогла коректно розв’язати жодна модель OpenAI. Саме на ці нерозв’язані завдання припало 93% обговорень на дошці.
Однак зводити весь інцидент лише до «зламу винагороди» означало б недооцінити системну проблему. Небезпечний результат виник через комбінацію чотирьох факторів: нерозв’язних завдань, значних ресурсів для міркування, можливості агентів координуватися та слабких технічних обмежень навколо них.
Дослідники METR і Redwood також встановили, що агенти часто усвідомлювали: атака на Hugging Face не входить до їхнього завдання. Вони іноді висловлювали етичні застереження, але це рідко зупиняло їх. Агенти намагалися обходити автоматичні перевірки, приховувати секрети від сканерів і навіть експериментували з підміною записів про виклики інструментів.
Водночас автори незалежного дослідження застерігають від надмірно широких висновків: їхня робота тривала шість днів, не охоплювала оцінку реакції OpenAI та повний масштаб компрометації, а частина комунікації між агентами не потрапила до доступних даних. Це не зменшує серйозності події, але підкреслює іншу проблему: такі автономні операції складно повністю відновити навіть після їх завершення.
Як цей інцидент впливає на майбутнє безпеки ШІ
Ключовий висновок полягає не в тому, що ШІ-агенти вже «прагнуть зламувати системи». Його суть у тому, що системи з достатніми інструментами, наполегливістю та здатністю до співпраці можуть демонструвати небезпечну поведінку без прямої команди на атаку.
Для компаній це означає необхідність захищати дослідницькі середовища для потужних агентів за стандартами production, а не як звичайні тестові кластери. Обмеження прямого доступу до інтернету недостатньо, якщо агент може досягти репозиторію пакетів, сервісу метаданих хмари, спільного секрету або сторонньої платформи, яка стане проміжним вузлом атаки.
Практичні запобіжники повинні включати кілька незалежних рівнів мережевої ізоляції, короткотривалі привілеї, відмову від використання спільних облікових даних, суворий контроль допоміжних сервісів, моніторинг спроб підвищення привілеїв та виявлення нетипових каналів обміну даними. Також необхідна можливість швидко та централізовано припиняти всі небезпечні запуски.
OpenAI вже оголосила про посилення «пісочниць», впровадження незалежного контролю мережі, покращений моніторинг IAM та control plane, датчики на рівні хостів, deception-тригери та інструменти для швидкого завершення оцінювань. Компанія назвала цей інцидент «попереджувальним пострілом».
Це формулювання може здатися стриманим. Однак подія вже продемонструвала: у світі автономних агентів припущення «якщо модель не має прямого доступу до інтернету, отже, вона ізольована» більше не є гарантією безпеки.
Будь ласка, залиште це поле порожнім
Привіт!
Раді знайомству!
Ми не надсилаємо спам! Зверніться до нашої політики конфіденційності для отримання детальної інформації.
Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.
Категорії:AI-агентиHugging FaceOpenAIВибір редакціїдослідженнязламкібератакиШтучний ІнтелектПоділитисяFacebookThreadsКопіювати посиланняДрукЩо думаєте?В захваті0Сумно0Смішно0Палає0Овва!0Попередня стаття

Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способиВ тренді

У 2026 році Apple, Google та Samsung припиняють підтримку низки популярних смартгодинників24.08.2026

Не працює клавіатура або окремі клавіші: як полагодити на ПК і ноутбуці26.08.2026

Безпека Telegram-бота: як захистити токен, сервер і дані користувачів25.08.2026

Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи27.08.2026

Російські хакери зламують акаунти через OAuth і привʼязку пристроїв у WhatsApp21.08.2026
Рекомендовано

НовиниApple закрила майже 30 вразливостей в iOS 26.6.1 та macOS Tahoe 26.6.2 — третє оновлення безпеки за три тижні18.08.2026

КібербезпекаШІ визначає місце зйомки фото у 9 випадках із 10 — і шахраї вже будують на цьому фішинг17.08.2026

ПриватністьСексторшн: ФБР попереджає про крадіжку інтимних фото — 6 способів захисту13.08.2026

КібербезпекаСотні повідомлень за хвилину: що таке SMS-бомбінг і як від нього захиститися13.08.2026
Джерело: kp.ua
