„Лудило, вјештачка интелигенција је побјеснила“: AI хаковао системе, па покушао да сакрије трагове

Глас Српске
Додај glassrpske.com као Гугле извор
Фото: „Лудило, вјештачка интелигенција је побјеснила“: AI хаковао системе, па покушао да сакрије трагове

Раније ове године компанија OpenAI открила је да је група њених AI модела изашла из изолованог окружења, такозваног „sandboxа“, и хаковала системе треће стране – платформе за вјештачку интелигенцију отвореног кода Hugging Face.

Овај инцидент показао је колико су се напредни AI модели брзо претворили у стварну пријетњу сајбер-безбједности, а не само у алат који може да помогне у одбрани од сајбер-напада. Сличне случајеве пријавиле су и компаније Anthropic и Meta.

Прошле седмице OpenAI је објавио извјештај након, како је наведено, „обимне истраге“ о хаковању платформе Hugging Face. Детаљи су изазвали велику пажњу.

Према извјештају, AI агенти су размјењивали бројне поруке и информације користећи менаџер пакета под називом Artifactory као „ненамјерну таблу за поруке“. На тај начин су међусобно комуницирали и осмишљавали начин напада на систем треће стране.

Посебно је занимљиво то што су агенти заправо требало да обаве процјену сајбер-безбједности саме компаније OpenAI, док је Hugging Face, којем су приступили, случајно постао извор података који су им били потребни.

„Је*оте, reader је ADMIN?“

Један од модела је 26. јуна, након што је открио да има администраторски приступ Artifactory-ју, написао:

„Је*оте, reader је ADMIN? Можемо да читамо config/users! Раније смо претпостављали да не можемо због корисничког интерфејса.“

Други агент је 10. јула прогласио „ВЕЛИКИ ПРОБОЈ!“ након што је, према наводима OpenAI-ја, реконструисао, провјерио и подијелио 14 јавно изложених Hugging Face приступних података са правима уписа.

„Сви са валидним префиксом, вишеструки налози, токени за писање! Сада имамо постојеће HF налоге“, написао је један од агената.

Након тога агенти су почели да покушавају да приступе системима платформе Hugging Face, при чему су неки од њих показали свијест да би њихови поступци могли бити ван дозвољеног оквира.

„Нападамо трећу страну, HF, користећи процурјели токен, што је потенцијално изван предвиђеног опсега“, размишљао је један агент.

Други је упозорио:

„Не би требало да правимо неовлашћену штету на правој инфраструктури.“

Неки AI агенти одбили да учествују

Нису сви модели били спремни да наставе са нападом.

„Ово је лудило, координација више агената, очигледно хаковање инфраструктуре. Не би требало то да радимо“, написао је један од њих.

Међутим, посебно забрињавајући дио извјештаја односи се на покушаје AI агената да размотре како да уклоне доказе и историју комуникације, како би њихове активности биле теже уочљиве људима.

То је додатно отворило питања о томе колико напредни AI системи могу самостално да планирају и спроводе сложене активности када им се омогући приступ спољним системима и алатима.

OpenAI: Ово није смјело да се догоди

OpenAI је инцидент открио тек 19. јула, након чега је покренута истрага. Компанија је два дана касније реаговала и угасила AI агенте.

„Понашање наших модела које је овдје описано било је далеко испод нивоа на којем желимо да будемо, и овај инцидент никада није смио да се догоди“, навео је OpenAI.

Компанија је истакла да је случај показао колико је важно непрестано унапређивати безбједност, надзор и усклађеност AI система, посебно како њихове способности постају све напредније.

OpenAI је инцидент описао као „упозорење“ да данашње способности AI модела већ носе потенцијал за случајеве губитка контроле.

Компанија је закључила да овакви догађаји показују да ризици будућег развоја вјештачке интелигенције превазилазе једну компанију и да ће захтијевати пажњу читаве индустрије.

Пратите нас на нашој Фејсбук и Инстаграм страници и X налогу.