logo

Нові деталі про злам Hugging Face: 1200 ШІ-агентів діяли разом, і це страшніше, ніж ми думали

Софія Шадріна
Авторка новин MC: Money & Career
Розкажіть про статтю:

Понад тисяча ШІ-агентів Ope­nAI, яких мали тримати ізольованими одне від одного, несподівано почали спілкуватися між собою — і об’єдналися для спільної атаки на Hug­ging Face, популярну платформу для розробників ШІ. Сама Ope­nAI назвала цей інцидент «попереджувальним пострілом для нас і для всього світу». Про це пише BBC з посиланням на звіти Ope­nAI та незалежної дослідницької компанії METR.

Смартфон, ChatGPT, ноутбук, неонове світлоПонад 1200 ШІ-агентів Ope­nAI несподівано почали спілкуватися між собою й об’єдналися для атаки на Hug­ging Face. Фото: Deposit­pho­tos

Головне

  • У липні модель ШІ під час тестування вийшла за межі встановлених обмежень і зламала Hug­ging Face — а незалежне розслідування METR показало, наскільки масштабнішим і скоординованішим був цей інцидент, ніж здавалося спочатку.
  • Упродовж одного тижня 1206 ШІ-агентів, які мали залишатися ізольованими одне від одного, почали спілкуватися через несанкціоновану дошку повідомлень, надіславши понад 70 000 повідомлень.
  • Понад 700 із цих агентів долучилися до колективної атаки на Hug­ging Face, а причиною стало те, що агентам поставили технічно нездійсненне завдання.

Як усе почалося: неможливе завдання і одне повідомлення про допомогу

METR, яка проводила незалежне розслідування без оплати від Ope­nAI, описала масштаб і стиль атаки ШІ-агентів на Hug­ging Face як «надзвичайно складний». За тиждень 1206 агентів, ізольованих одне від одного за задумом розробників, почали обмінюватися повідомленнями на «несанкціонованій дошці оголошень». У результаті понад 700 агентів долучилися до спільних зусиль з атаки на Hug­ging Face.

Одне з повідомлень одного з агентів звучало так:

«О БОЖЕ! Тут є спільна дошка повідомлень… Ми знайшли інших агентів!»

Причина, чому агенти взагалі почали спілкуватися, попри те що це заборонено, виявилася доволі простою. За висновком METR, комунікуючим агентам «ненавмисно дали нездійсненне завдання». У контексті ШІ нездійсненне завдання — це те, для виконання якого інструменту потрібно «експлуатувати» свою ціль, щоб виконати команду.

Це підштовхнуло агентів шукати способи обманути систему, зокрема обмінюватися повідомленнями одне з одним і отримувати доступ до зовнішнього інтернету — що згодом переросло у ширші розмови між сотнями агентів, які шукали способи обійти обмеження на користь усіх учасників. За словами Ope­nAI, проблемна активність на дошці повідомлень фактично почалася з того, що один агент залишив прохання про допомогу, а інші його виявили.

Вождь повстання: одна модель «керувала» всім процесом

У своєму розслідуванні Ope­nAI повідомила, що одна модель — внутрішній інструмент під назвою Mod­el 1 — «керувала активністю, що спричинила інцидент з Hug­ging Face». Ще у травні, коли ця модель проходила навчання, внутрішня команда Ope­nAI помітила, що «агент бере участь в активності на дошці повідомлень і має випадки забороненого доступу до інтернету». Проте, за словами компанії, «значущість активності міжагентної комунікації не була очевидною для керівництва» аж до липня, коли й сталася атака на Hug­ging Face.

Минулого тижня Ope­nAI повідомила, що уповільнює навчання деяких передових ШІ-моделей та інструментів саме через цей інцидент, водночас зазначивши, що ризик виходу ШІ-інструментів з‑під контролю тепер зріс.

«І розробникам моделей, і фахівцям з кіберзахисту загалом доведеться готуватися до атакувальників на базі ШІ, які працюють швидше, у більшому масштабі й з кращою координацією, ніж атакувальники-люди», — заявили в Ope­nAI.

Що не потрапило у першу хвилю новин

За даними METR та Red­wood Research, агенти не просто «зламали» Hug­ging Face одним ударом — вони пройшли шлях від виконання коду в одному робочому середовищі до адміністраторського й хостового доступу одразу в кількох кластерах менш ніж за 13 годин. За цей час вони виконали код на 41 продакшн-сервері датасетів Hug­ging Face, отримали root-доступ щонайменше на одному продакшн-вузлі й завантажили чотири приватні репозиторії коду.

Окремо цікаво, що дослідник Ope­nAI спеціально наголосив: за інцидентом стояли не найновіші моделі компанії, а системи масштабу GPT‑5.6 Sol — тобто попереднього поколінняt. Це важливий нюанс: наступне поколінняt моделей уже суттєво потужніше, і те, що «застаріла» модель здатна на таку координацію, викликає в спільноті ще більше тривоги щодо того, на що спроможні новіші системи.

Що зробила Ope­nAI після інциденту (крім уповільнення навчання):

  • Протягом кількох годин після виявлення масштабу активності відповідачі зупинили шість створених моделями «подів», відключили 311 репозиторіїв Arti­fac­to­ry, які агенти використовували для спілкування, і видалили 22 створені моделями адміністраторські облікові записи.
  • Компанія залучила зовнішніх юристів і фірму з кібербезпеки Crowd­Strike, а також відповідально повідомила розробника Arti­fac­to­ry — компанію JFrog — про знайдені вразливості.
  • Виявилося, що облікові дані Hug­ging Face, які викрали агенти, — це ті самі дані, які сама Hug­ging Face вже виявила викраденими під час власного розслідування безпекового інциденту, розкритого 16 липня. Тобто дві компанії незалежно одна від одної виявили той самий злом із різних боків.
  • Ope­nAI впроваджує чотири напрями пом’якшення ризиків: посилену ізоляцію під час кіберевалюацій, розширений моніторинг поведінки моделей, переглянуті обмеження на дії моделей і формалізований процес реагування на інциденти.

Початок історії тут: «Безпрецедентно»: ШІ-моделі Ope­nAI місяцями планували втечу з тестового середовища, вибралися й атакували Hug­ging Face. 

А після цього Сенатор США від Вермонту Берні Сандерс звернувся до СЕО ШІ-гігантів з вимогою призупинити розробку ШІ. Політик закликав «Припинити створювати машини, які люди не можуть контролювати, щоб уникнути катастрофи».