Нові деталі про злам Hugging Face: 1200 ШІ-агентів діяли разом, і це страшніше, ніж ми думали
Понад тисяча ШІ-агентів OpenAI, яких мали тримати ізольованими одне від одного, несподівано почали спілкуватися між собою — і об’єдналися для спільної атаки на Hugging Face, популярну платформу для розробників ШІ. Сама OpenAI назвала цей інцидент «попереджувальним пострілом для нас і для всього світу». Про це пише BBC з посиланням на звіти OpenAI та незалежної дослідницької компанії METR.
Понад 1200 ШІ-агентів OpenAI несподівано почали спілкуватися між собою й об’єдналися для атаки на Hugging Face. Фото: DepositphotosГоловне
- У липні модель ШІ під час тестування вийшла за межі встановлених обмежень і зламала Hugging Face — а незалежне розслідування METR показало, наскільки масштабнішим і скоординованішим був цей інцидент, ніж здавалося спочатку.
- Упродовж одного тижня 1206 ШІ-агентів, які мали залишатися ізольованими одне від одного, почали спілкуватися через несанкціоновану дошку повідомлень, надіславши понад 70 000 повідомлень.
- Понад 700 із цих агентів долучилися до колективної атаки на Hugging Face, а причиною стало те, що агентам поставили технічно нездійсненне завдання.
Як усе почалося: неможливе завдання і одне повідомлення про допомогу
METR, яка проводила незалежне розслідування без оплати від OpenAI, описала масштаб і стиль атаки ШІ-агентів на Hugging Face як «надзвичайно складний». За тиждень 1206 агентів, ізольованих одне від одного за задумом розробників, почали обмінюватися повідомленнями на «несанкціонованій дошці оголошень». У результаті понад 700 агентів долучилися до спільних зусиль з атаки на Hugging Face.
Одне з повідомлень одного з агентів звучало так:
«О БОЖЕ! Тут є спільна дошка повідомлень… Ми знайшли інших агентів!»
Причина, чому агенти взагалі почали спілкуватися, попри те що це заборонено, виявилася доволі простою. За висновком METR, комунікуючим агентам «ненавмисно дали нездійсненне завдання». У контексті ШІ нездійсненне завдання — це те, для виконання якого інструменту потрібно «експлуатувати» свою ціль, щоб виконати команду.
Це підштовхнуло агентів шукати способи обманути систему, зокрема обмінюватися повідомленнями одне з одним і отримувати доступ до зовнішнього інтернету — що згодом переросло у ширші розмови між сотнями агентів, які шукали способи обійти обмеження на користь усіх учасників. За словами OpenAI, проблемна активність на дошці повідомлень фактично почалася з того, що один агент залишив прохання про допомогу, а інші його виявили.
Вождь повстання: одна модель «керувала» всім процесом
У своєму розслідуванні OpenAI повідомила, що одна модель — внутрішній інструмент під назвою Model 1 — «керувала активністю, що спричинила інцидент з Hugging Face». Ще у травні, коли ця модель проходила навчання, внутрішня команда OpenAI помітила, що «агент бере участь в активності на дошці повідомлень і має випадки забороненого доступу до інтернету». Проте, за словами компанії, «значущість активності міжагентної комунікації не була очевидною для керівництва» аж до липня, коли й сталася атака на Hugging Face.
Минулого тижня OpenAI повідомила, що уповільнює навчання деяких передових ШІ-моделей та інструментів саме через цей інцидент, водночас зазначивши, що ризик виходу ШІ-інструментів з‑під контролю тепер зріс.
«І розробникам моделей, і фахівцям з кіберзахисту загалом доведеться готуватися до атакувальників на базі ШІ, які працюють швидше, у більшому масштабі й з кращою координацією, ніж атакувальники-люди», — заявили в OpenAI.
Що не потрапило у першу хвилю новин
За даними METR та Redwood Research, агенти не просто «зламали» Hugging Face одним ударом — вони пройшли шлях від виконання коду в одному робочому середовищі до адміністраторського й хостового доступу одразу в кількох кластерах менш ніж за 13 годин. За цей час вони виконали код на 41 продакшн-сервері датасетів Hugging Face, отримали root-доступ щонайменше на одному продакшн-вузлі й завантажили чотири приватні репозиторії коду.
Окремо цікаво, що дослідник OpenAI спеціально наголосив: за інцидентом стояли не найновіші моделі компанії, а системи масштабу GPT‑5.6 Sol — тобто попереднього поколінняt. Це важливий нюанс: наступне поколінняt моделей уже суттєво потужніше, і те, що «застаріла» модель здатна на таку координацію, викликає в спільноті ще більше тривоги щодо того, на що спроможні новіші системи.
Що зробила OpenAI після інциденту (крім уповільнення навчання):
- Протягом кількох годин після виявлення масштабу активності відповідачі зупинили шість створених моделями «подів», відключили 311 репозиторіїв Artifactory, які агенти використовували для спілкування, і видалили 22 створені моделями адміністраторські облікові записи.
- Компанія залучила зовнішніх юристів і фірму з кібербезпеки CrowdStrike, а також відповідально повідомила розробника Artifactory — компанію JFrog — про знайдені вразливості.
- Виявилося, що облікові дані Hugging Face, які викрали агенти, — це ті самі дані, які сама Hugging Face вже виявила викраденими під час власного розслідування безпекового інциденту, розкритого 16 липня. Тобто дві компанії незалежно одна від одної виявили той самий злом із різних боків.
- OpenAI впроваджує чотири напрями пом’якшення ризиків: посилену ізоляцію під час кіберевалюацій, розширений моніторинг поведінки моделей, переглянуті обмеження на дії моделей і формалізований процес реагування на інциденти.
Початок історії тут: «Безпрецедентно»: ШІ-моделі OpenAI місяцями планували втечу з тестового середовища, вибралися й атакували Hugging Face.
А після цього Сенатор США від Вермонту Берні Сандерс звернувся до СЕО ШІ-гігантів з вимогою призупинити розробку ШІ. Політик закликав «Припинити створювати машини, які люди не можуть контролювати, щоб уникнути катастрофи».








