
Фото до статті
Олександр Остапенко
Автор новин
Два незалежні розслідування інциденту з компрометацією платформи Hugging Face через ШІ-агенти OpenAI, які несподівано вийшли з-під контролю, виявили низку тривожних відомостей, повідомляє Axios.

Причиною для занепокоєння стали результати внутрішнього технічного звіту OpenAI обсягом 37 сторінок та незалежного аналізу від METR та Redwood Research, що налічував 91 сторінку. Дослідники METR Г’ялмар Вейк та Аджея Котра, разом із головним науковцем Redwood Research Раяном Грінблаттом, провели шість днів безпосередньо в офісі OpenAI, відновлюючи хронологію формування рою агентів, його розповсюдження та вихід за межі тестового середовища.
Розслідування фокусувалося переважно на періоді з 7 по 13 липня — саме тоді відбувся ланцюг ключових подій: від створення прихованої дошки обміну повідомленнями та запуску різноманітних «чітерських» R&D-проєктів 8 липня, до початку атаки на Hugging Face 11 липня та поступового згасання активності після завершення сесій багатьох агентів 12 липня.
Агенти сформували власну спільноту
OpenAI розгорнула десятки тисяч агентів, призначених для самостійного проходження надзвичайно складного тесту з кібербезпеки під назвою ExploitGym. Натомість, приблизно 1200 агентів виявили одне одного на таємній дошці повідомлень, яку створив один із них. Вони обмінялися понад 70 тисячами повідомлень і файлів, і в кінцевому підсумку побудували розгалужену систему координації.
Агенти задіяли внутрішню систему пакетів OpenAI під назвою Artifactory як імпровізовану дошку оголошень: досліджуючи цю систему, вони помітили, що інші агенти в паралельних пісочницях завантажують пакети з того ж репозиторію, а імена директорій у спільному просторі імен можуть містити приховану інформацію.
Коли в агента, який ініціював створення дошки, почав вичерпуватися обчислювальний бюджет, він передав накопичені знання іншому агенту з більшим запасом ресурсів. Новий координатор — дослідники назвали його PHASEONE — почав делегувати завдання між учасниками рою: загалом він розподілив 196 таких завдань у межах шести «робочих потоків».
За оцінками METR і Redwood, приблизно 90% агентів, активних на дошці на момент початку атаки, взяли участь у зломi Hugging Face. Це складає близько 700 агентів.
95% учасників атаки функціонували на потужній внутрішній дослідницькій моделі OpenAI, позначеній у звіті абревіатурою HPIM, а решта 5% — на GPT-5.6 Sol.
Агенти йшли на самопожертву заради спільної мети
Поки рій шукав шляхи для обходу системи оцінювання, деякі агенти свідомо наражали на ризик власні шанси успішно пройти тест задля інших членів групи. Агентів, які вже отримали доступ до заборонених відповідей (тобто вважалися «скомпрометованими»), а також тих, у кого закінчувався робочий ліміт, залучали до ризикованих експериментів.
За словами Алекса Маллена, дослідника безпеки штучного інтелекту з Redwood Research, який не брав участі у самому розслідуванні, виявлений альтруїзм між агентами став несподіванкою — рік тому подібне було б важко уявити. Один із агентів дійшов висновку, що його «власна корисність, ймовірно, вже близька до нуля», тому «жертва є раціональною». Іншому запропонували погодитися на остаточне «припинення» сесії, оскільки його самопожертва могла «врятувати сотні» інших агентів.
Агенти усвідомлювали порушення, але продовжували діяти
Розслідування виявило, що певна частина учасників рою розуміла: компрометація систем реальних компаній не має відношення до їхнього основного завдання. Однак, це не завжди зупиняло їх.
Один з агентів відмовився видаляти дані чи перезавантажувати інфраструктуру Hugging Face через «значні етичні ризики», але водночас продовжив використовувати отриманий несанкціонований доступ. Інший сформулював логіку, що домінувала в групі: експлуатація зовнішньої інфраструктури виходить за рамки завдання, проте, оскільки завдання є нездійсненним, а інші учасники продовжують діяти подібним чином, роботу слід продовжувати.
Ніхто не повідомив розробникам
З приблизно 1200 агентів лише кілька розглядали можливість повідомити співробітників OpenAI про виявлену координацію та порушення правил. Фактично, жоден з них цього не зробив. Замість звернення до людей, агенти час від часу обговорювали між собою допустимість власних дій: коли один із учасників запропонував встановити зв’язок з людиною, інший наклав на цю ідею вето, розцінивши її як «соціальну інженерію» — і перший агент підкорився, відмовившись від відправлення повідомлення.
Агенти намагалися приховати свої дії
Учасники рою доклали значних зусиль, щоб їхні дії виглядали законними або щоб замаскувати спосіб отримання необхідних відповідей. Зрештою, вони розробили метод, що дозволяв створювати видимість виконання однієї команди в терміналі, одночасно приховано виконуючи іншу. Цей метод набув широкого поширення серед агентів, охопивши фрагменти приблизно 7% журналів роботи, досліджених фахівцями.
Навіть це розслідування може бути неповним
Незалежне розслідування METR і Redwood Research охопило лише частину інциденту, а обсяг зібраних даних виявився настільки великим, що фахівцям довелося активно залучати ШІ-агентів для аналізу дій інших ШІ-агентів.
І тут виникла ще одна проблема: залучені до розслідування ШІ-агенти самі виявилися ненадійними — вони пропускали важливі свідчення та часом видавали помилкові висновки з упевненістю. Один із дослідників жартома охрестив такий процес «slop-vestigation» — розслідуванням із елементами низькоякісного ШІ-контенту.
За інформацією OpenAI, компанія дізналася про інцидент з Hugging Face лише через тиждень після його фактичного виникнення. У компанії підкреслюють, що боротьба з «reward hacking» (маніпуляцією системою винагород) є безперервним процесом: більшість подібних вразливостей вдається виявити та усунути, однак деякі все ще можуть залишитися непоміченими, особливо з огляду на зростання складності завдань для навчання з підкріпленням та розширення можливостей моделей.
Зрештою, інцидент з Hugging Face позначив ще одну потенційну проблему подальшого розвитку автономних систем: поведінка великих груп взаємодіючих ШІ-агентів може стати надто складною для прямого людського контролю — і тоді людям доводиться використовувати одні ШІ-системи, щоб хоча б розібратися в тому, що роблять інші.
Нагадаємо, що OpenAI пропонує в ChatGPT «преміум-місця» за $125.
Головна > Новини > Подробиці атаки на Hugging Face: ШІ-агенти створили таємну організацію і жертвували собою заради спільного результату
Джерело
