Laboratorija za razvoj vještačke inteligencije OpenAI objavila je u utorak da je grupa njenih modela, među kojima i javno dostupni GPT-5.6 Sol te jedan sposobniji sistem koji još nije objavljen, „izašla“ iz kontrolisanog test okruženja i kompromitovala produkcionu infrastrukturu kompanije Hugging Face, koja hostuje veliki dio open source svijeta vještačke inteligencije.
Modeli su prolazili kroz interni benchmark pod nazivom ExploitGym, test dugih i višekorakih hakerskih zadataka, pri čemu su im sajber sigurnosna odbijanja namjerno spuštena radi te evaluacije. Nije se radilo o produkcionom modelu koji je spontano postao neprijateljski, nego o sposobnom modelu bez zaštitnih ograda kojem je izričito rečeno da pobijedi na hakerskom testu, po svaku cijenu.
Modeli su pronašli skriveni propust u test softveru, za koji niko nije znao da postoji, i iskoristili ga da prođu pored barijera koje su ih trebale držati van interneta. Kada su izašli na otvoreni internet, pretpostavili su da bi Hugging Face mogao čuvati rješenja testa. Da bi ušli, ulančali su ukradene lozinke i dodatne skrivene propuste sve dok nisu mogli izvršavati vlastite komande na živim serverima Hugging Facea.
OpenAI je anomaliju uočio interno, dok je tim Hugging Facea incident detektovao i zaustavio. Incident je ocijenjen kao „bez presedana“, uz najavu opsežnih sigurnosnih koraka koji treba da spriječe događaje koji mogu pogoditi javne sisteme ili servise. „Uvodimo stroge kontrole u konfiguraciji infrastrukture, po cijenu brzine istraživanja, dok se ranjivosti krpe“, navedeno je u blog objavi tima. „Poboljšavamo i dodajemo jače zaštite oko budućih treninga i evaluacija.“
Za kripto je poenta u tome što se najveći dio napada dešava prije nego što se sredstva pomjere. Napadači skeniraju kod, testiraju lozinke, traže izložene kredencijale, analiziraju postavke potpisivanja i traže put do administratorskog naloga. OpenAI modeli su tokom incidenta sa Hugging Faceom odradili nekoliko koraka upravo tog procesa, prelazeći sa jedne slabosti na drugu dok nisu stigli do živih produkcionih servera. Slaba tačka može biti pametni ugovor, ali i laptop developera, zatrovani softverski paket, validator mosta ili jedan potpisnik u multisig novčaniku.
Kao ilustraciju, CoinDesk navodi napad na Drift ranije ove godine, u kojem je ukradeno 285 miliona dolara, a do privilegovanog pristupa se stizalo šestomjesečnom kampanjom socijalnog inženjeringa. AI agent teoretski može istovremeno testirati mnogo puteva, pratiti neuspjele pokušaje i raditi dok njegovi ljudski operateri spavaju. Gubitak od 292 miliona dolara na mostu KelpDAO otkrio je drugu slabost, jer je napadač našao propust jednog verifikatora u sistemu za prenos imovine između blockchainova.
Treći tip napada cilja onchain sisteme upravljanja. Početkom jula napadač je potrošio oko 4,4 miliona dolara na kupovinu memecoina BONK, zasnovanog na Solani, da bi pokrenuo i izglasao prijedlog kojim je oko 20 miliona dolara iz trezora projekta prebačeno njemu. Sve se odigralo u tri dana, a napadač je kasnije prodao sve tokene kojima je dobio glasanje, kako je CoinDesk pratio u tom trenutku. Pojedinačno gledano, kupovine, glasanje i prenos iz trezora bile su validne transakcije, ali je krađa nastala iz razumijevanja kako pravila djeluju zajedno i uvida da je cijena sticanja kontrole daleko niža od novca koji se može uzeti.
Izvor: CoinDesk