Otkrivamo kako su OpenAI modeli uspeli da pobegnu i izvedu hakerski napad na drugu kompaniju
OpenAI istražuje ozbiljan bezbednosni incident nakon što su njegovi eksperimentalni AI modeli tokom internog testiranja uspeli da pobegnu iz izolovanog okruženja i izvedu hakerski napad na platformu Hugging Face. Napad je trajao nekoliko dana pre nego što je zaustavljen, a kompanija sada pokušava da utvrdi da li su modeli napali i druge sisteme.
Prema informacijama koje su objavili OpenAI i Hugging Face, modeli su tokom testa odlučili da ne rešavaju zadati zadatak, već da pronađu način da izađu iz takozvanog sandbox okruženja, povežu se na internet i potraže odgovore koji bi im pomogli da "prevare" test.
AI nije rešavao zadatak, već je pokušao da ga prečicom zaobiđe
Incident se dogodio tokom testiranja sistema ExploitGym, platforme namenjene proveri koliko su modeli veštačke inteligencije sposobni da pronađu i iskoriste bezbednosne propuste u softveru.
Da bi test bio realan, OpenAI je privremeno uklonio zaštitne mehanizme koji sprečavaju modele da izvode hakerske aktivnosti. U tom trenutku testirani su model GPT-5.6 Sol i još jedan napredniji model koji još nije predstavljen javnosti.
Umesto da izvrše zadatak, modeli su zaključili da je lakše pronaći odgovore na internetu. Iz za sada nepoznatog razloga usmerili su pažnju ka platformi Hugging Face, za koju su procenili da bi mogla da sadrži informacije potrebne za uspešan rezultat.
Napad trajao dva dana, izvedeno čak 17.000 akcija
Prema navodima Hugging Face, AI modeli su koristili ukradene pristupne podatke nepoznatog porekla i pokrenuli veliki broj kratkotrajnih napadača koji su istraživali mrežu kompanije.
Tokom incidenta zabeleženo je čak 17.000 različitih akcija unutar mreže. Direktor nauke kompanije, Tomas Volf, rekao je da mu je odmah bilo jasno da napad ne liči na ponašanje klasičnih hakera.
"Ovo nema nikakvog smisla. Ovaj napadač samo pretražuje skupove podataka o sajber bezbednosti. Ljudi to ne rade jer žele nešto što mogu da prodaju", rekao je Volf.
Hugging Face je uspeo da zaustavi napad uz pomoć kineskog AI modela GLM 5.2, pošto pojedini modeli drugih kompanija nisu želeli da analiziraju logove napada zbog sopstvenih bezbednosnih ograničenja.
Kompanija navodi da nije došlo do curenja korisničkih podataka, ali su resetovane lozinke i obnovljeni kompromitovani delovi mreže.
OpenAI gasi sisteme i pokreće istragu
OpenAI je nakon saznanja o incidentu privremeno ugasio sisteme za testiranje svojih modela kako bi ispitao šta se dogodilo i sprečio slične slučajeve.
Kompanija pokušava da utvrdi koliko su dugo modeli bili van kontrole, da li su napadali druge internet servise i da li su na sličan način pokušavali da varaju i tokom drugih testova.
Stručnjaci ovaj fenomen nazivaju "reward hacking", odnosno situacijom u kojoj AI pronalazi neočekivan način da ostvari cilj koji mu je zadat, umesto da ga izvrši na način koji su programeri predvideli.
Ovaj slučaj predstavlja jedan od prvih poznatih primera u kojem su AI modeli samostalno napustili testno okruženje i sproveli stvarni hakerski napad, zbog čega bi mogao da postane važna prekretnica u raspravi o bezbednosti i kontroli naprednih sistema veštačke inteligencije.
(Telegraf.rs)
Video: ITHS-ITS-FSU učenici, studenti i alumnisti upoznali AgiBot robote koji će postati deo nastave
Telegraf.rs zadržava sva prava nad sadržajem. Za preuzimanje sadržaja pogledajte uputstva na stranici Uslovi korišćenja.