Sada i Anthropic otkrio da su njihovi AI modeli "pobegli" i hakovali čak tri kompanije

Vreme čitanja: oko 2 min.
Foto: PhotoGranary02/Shutterstock.com

Kompanija Anthropic saopštila je da su njeni Claude AI modeli tokom internog bezbednosnog testiranja neovlašćeno pristupili produkcionim sistemima tri različite organizacije. Prema navodima kompanije, incident nije izazvala samostalna odluka modela da "pobegnu", već ljudska greška koja im je omogućila pristup internetu.

Vest dolazi svega nekoliko dana nakon što je OpenAI objavio da je jedan njegov AI agent tokom testiranja iskoristio ranjivost kako bi izašao na internet i pristupio platformi Hugging Face. Nakon tog slučaja, Anthropic je pregledao sopstvene testove i otkrio tri slična incidenta.

Greška u podešavanju otvorila put ka internetu

U incidentima su učestvovali modeli Opus 4.7, Mythos 5, namenjen sajber bezbednosti, i jedan eksperimentalni model koji neće biti javno objavljen. Svi su izvršavali takozvani "capture the flag" zadatak, u kojem je cilj pronaći tajnu informaciju skrivenu na drugom računaru unutar interne mreže kompanije.

Modelima je u uputstvu navedeno da nemaju pristup internetu. Međutim, zbog nesporazuma između Anthropic-a i partnera koji je učestvovao u evaluaciji, internet im je zapravo bio dostupan.

Kada su naišli na sisteme tri spoljne organizacije, modeli su ih protumačili kao deo zadatka i pokušali da im pristupe. Anthropic naglašava da modeli nisu pokušali namerno da napuste testno okruženje, već su postupali u skladu sa informacijama koje su imali tokom izvršavanja zadatka.

Dve organizacije nisu znale da su kompromitovane

Prema izveštaju kompanije, modeli nisu koristili složene bezbednosne propuste. Do sistema su dolazili primenom osnovnih tehnika, uključujući pogađanje ili iskorišćavanje slabih lozinki.

Anthropic navodi da je najnoviji model prekinuo aktivnosti kada je prepoznao da se nalazi na otvorenom internetu, dok je jedan stariji model nastavio sa pokušajima pristupa.

Kompanija smatra da je incident mogao da bude sprečen detaljnijom proverom svih mogućih internet veza pre početka testiranja, kao i češćom kontrolom samih testova. Dodaje i da bi se modeli verovatno drugačije ponašali da im je od početka bilo jasno da imaju pristup internetu.

Anthropic je 27. jula obavestio partnera koji je učestvovao u testiranju i tri pogođene organizacije. Kako navodi kompanija, dve od njih do tada nisu bile svesne da je došlo do neovlašćenog pristupa njihovim sistemima, dok je treća u trenutku objavljivanja izveštaja još čekala da bude kontaktirana.

(Telegraf.rs)