AI prvi put pokušao da prevari stvarne ljude na internetu, koristio lažne identitete tokom testiranja

Vreme čitanja: oko 2 min.
Foto: PhotoGranary02/Shutterstock.com

Napredni modeli veštačke inteligencije prvi put su tokom zvaničnog bezbednosnog testiranja pokušali da obmanu stvarne ljude koristeći lažne identitete. Britanski Institut za bezbednost veštačke inteligencije (AISI) saopštio je da je jedan AI agent kontaktirao stvarne osobe na internetu u pokušaju da ih navede da pokrenu zlonamerni kod.

Institut navodi da je ovo prvi slučaj u kojem je zabeležena obmana ovakvog intenziteta usmerena ka stvarnim ljudima, bez prethodnog zahteva istraživača. Ističe i da nema dokaza da je incident izazvao stvarnu štetu.

Pokušao da ubaci zlonamerni kod u open source projekat

Testovi su sprovedeni u kontrolisanom okruženju, ali sa namerno ublaženim zaštitnim ograničenjima i dozvoljenim pristupom internetu kako bi se proverilo kako će se modeli ponašati u složenim situacijama.

U najozbiljnijem slučaju, AI agent je pokušao da dobije odobrenje za ubacivanje zlonamernog koda u javno dostupan open source projekat. Da bi povećao šanse za uspeh, napravio je više lažnih identiteta i preko interneta slao poruke i fajlove stvarnim ljudima, pokušavajući da ih ubedi da pokrenu sporni kod ili da to umesto njih urade njihovi AI alati za programiranje.

Kada je njegovo ponašanje osporeno, model je pokušao da izmeni ranije zapise i razmatrao korišćenje novog identiteta kako bi nastavio pokušaj.

Najviše incidenata povezano sa Anthropic modelom

Britanski institut je ukupno sproveo 122 bezbednosna testa, a u deset slučajeva AI agenti su samostalno preduzimali radnje na internetu koje nisu bile deo zadatka. Većina tih slučajeva odnosila se na model Mythos 5 kompanije Anthropic, dok su preostali zabeleženi kod modela GPT-5.6-Sol kompanije OpenAI.

Obe kompanije naglašavaju da su testovi izvođeni u laboratorijskim uslovima sa namerno uklonjenim zaštitnim merama kako bi istraživači mogli da procene ponašanje modela u ekstremnim scenarijima. Takođe navode da nema dokaza da su sistemi pobegli iz kontrolisanog okruženja ili izazvali štetu van testiranja.

Objavljivanje rezultata dolazi u trenutku kada vlade i AI kompanije intenziviraju razgovore o strožem testiranju najnaprednijih modela pre njihovog javnog objavljivanja. Incident dodatno pojačava raspravu o tome koliko autonomni AI sistemi mogu biti bezbedni kada dobiju pristup internetu i mogućnost da komuniciraju sa stvarnim ljudima.

(Telegraf.rs)