Bezbednost AI-ja: koje podatke ne treba deliti s veštačkom inteligencijom?
Stroga kontrola podataka koje unosite temelj je bezbednog korišćenja potrošačkih verzija jezičkih modela: informacije poslate javno dostupnim AI alatima napuštaju vaše lokalno okruženje. Unošenje poverljivih podataka nosi rizik od njihovog curenja, otkrivanja poslovnih tajni i kršenja propisa o zaštiti podataka o ličnosti. Zato svaki razgovor s AI alatom treba tretirati kao javnu objavu.
Šta ne treba unositi u AI alate?
U javno dostupne modele ne treba unositi sledeće kategorije podataka:
- podatke o ličnosti – imena, prezimena, adrese, jedinstvene matične brojeve građana (JMBG), brojeve telefona i imejl adrese klijenata, zaposlenih ili sopstvene podatke;
- medicinsku dokumentaciju – istorije bolesti, rezultate pregleda i dijagnoze pacijenata, koji podležu strogim propisima (npr. zakonu o zaštiti podataka o ličnosti ili HIPAA);
- poverljive poslovne informacije – neobjavljene finansijske izveštaje, marketinške strategije, baze klijenata i planove spajanja, preuzimanja ili otpuštanja;
- poslovne tajne – izvorni kod softvera, proizvodne recepture, jedinstvene algoritme i internu tehničku dokumentaciju preduzeća;
- lozinke i pristupne podatke – API ključeve, podatke za prijavu, autorizacione tokene, podatke o platnim karticama i ključeve za šifrovanje;
- materijale zaštićene autorskim pravom – celokupne tekstove knjiga, naučnih radova dostupnih uz naplatu ili skripti za koje nemate odgovarajuću licencu;
- nezakonit sadržaj – materijale koji promovišu nasilje ili mržnju, kao i uputstva za postupke protivne važećem zakonu.
Šta se dešava s podacima koje unosite u AI?
Podaci poslati pružaocima usluga u oblaku prolaze kroz više faza obrade i analize. Njihov životni ciklus ne završava se generisanjem odgovora.
Obučavanje modela
Podaci uneti u standardne potrošačke verzije generativnih alata često se koriste za dalje obučavanje modela. To znači da unete informacije mogu uticati na parametre neuronske mreže i, teoretski, kasnije se pojaviti u odgovoru drugom korisniku.
Ručna provera i moderacija
Pored automatske obrade, AI sistemi imaju bezbednosne filtere. Ako algoritam proceni da je upit sumnjiv, na primer da krši uslove korišćenja, razgovor može biti označen i prosleđen na ručnu proveru. Tada zaposleni kod pružaoca usluge ili spoljni saradnici za označavanje podataka mogu dobiti neposredan uvid u uneti sadržaj radi unapređenja moderacije.
Čuvanje podataka i rezervne kopije
Pružaoci AI usluga čuvaju razgovore na svojim serverima radi kontinuiteta usluge, dijagnostike grešaka i očuvanja konteksta za buduće sesije. Brisanje razgovora u korisničkom interfejsu retko znači i trenutno brisanje informacija sa servera. Podaci mogu ostati u rezervnim kopijama određeno vreme, što povećava rizik od otkrivanja poverljivih informacija u slučaju uspešnog sajber napada na infrastrukturu u oblaku.
Privatni i poslovni nalozi – razlike u nivou zaštite
Bezbednost podataka pri korišćenju AI-ja znatno zavisi od vrste pretplate i načina na koji je alat uveden.
Besplatni i plaćeni standardni privatni nalozi u mnogim popularnim servisima podrazumevano omogućavaju korišćenje unetih informacija za obučavanje modela. Zato svaka sesija nosi rizik od nekontrolisanog otkrivanja poverljivog sadržaja ako ga korisnik podeli.
U poslovnim i korporativnim okruženjima (npr. Enterprise nalozi ili usluge pokrenute u privatnom oblaku putem API-ja pružalaca kao što su Microsoft Azure, AWS i Google Cloud) standardi zaštite su stroži. Pružaoci usluga ugovorima (SLA/DPA) potvrđuju usklađenost s bezbednosnim standardima kao što su ISO 27001 i SOC 2, kao i s primenljivim propisima o zaštiti podataka, i navode da podatke klijenata ne koriste za obučavanje javnih osnovnih modela. Ograničenja u pogledu unosa podataka u takvim okruženjima mogu biti blaža, ali su i dalje potrebne politike upravljanja rizikom i kontrole pristupa.
Šta se može bezbedno uneti u AI alat?
Uprkos brojnim ograničenjima, postoje informacije koje se uglavnom mogu uneti u AI alat i obraditi bez značajnog rizika. To su, između ostalog:
- javno dostupni materijali – članci iz otvorenih izvora, blogovi, javno dostupni tržišni izveštaji, propisi i sadržaj s veb-stranica (npr. Vikipedije);
- informacije koje nisu poverljive – opšta uputstva, pitanja o teorijskim pojmovima, gramatička i pravopisna pravila, matematičke jednačine i značenja reči;
- anonimizovani delovi dokumentacije – šabloni dopisa, obrasci ugovora i delovi programskog koda iz kojih su u potpunosti uklonjene jedinstvene promenljive, ključevi, imena klijenata i detalji interne arhitekture;
- sopstveni autorski tekstovi – nacrti imejlova, objave za društvene mreže, planovi prezentacija i članci koji ne sadrže osetljive poslovne podatke;
- otvoreni skupovi podataka – sintetički podaci ili statistika iz javnih repozitorijuma koji se koriste za učenje analize i formatiranja.
Kako efikasno anonimizovati poruke i podatke pre slanja AI alatu?
Pre slanja poverljivih dokumenata jezičkom modelu, potrebno ih je pripremiti i ukloniti osetljive informacije. Tako možete raditi s tekstom bez nepotrebnog rizika od otkrivanja poverljivih podataka.
Uklanjanje identifikatora i tokenizacija
Tokenizacija podrazumeva zamenu osetljivih podataka veštačkim oznakama. Na primer, ime „Marko Petrović” može se zameniti oznakom „[Klijent_1]”, a naziv „Primer d.o.o.” oznakom „[Organizacija_A]”. Tako modelu ostaju struktura, sintaksa i kontekst dokumenta, dok se smanjuje mogućnost identifikacije osobe ili organizacije.
Tehnike maskiranja osetljivih informacija
Maskiranje znači neposredno skrivanje kritičnih nizova znakova, najčešće njihovom zamenom specijalnim znakovima (npr. broj kartice 4532 **** **** ****). Korisna je i generalizacija: umesto tačne vrednosti, kao što je plata od 180 000 RSD, navodi se raspon, na primer „plata između 160 000 i 200 000 RSD”. Time se smanjuje rizik od ponovne identifikacije.
Automatizacija postupka (DLP alati i RegEx)
Pri ručnom uklanjanju informacija iz dugih tekstova lako dolazi do propusta. U profesionalnim okruženjima koriste se skripte zasnovane na regularnim izrazima (RegEx) ili DLP sistemi (Data Loss Prevention). Ti alati mogu automatski pregledati upit pre slanja i otkriti, blokirati ili zameniti nizove znakova koji odgovaraju formatima JMBG-a, poreskog identifikacionog broja (PIB), imejl adresa ili brojeva bankovnih računa.
Podaci koje delite s AI-jem – kako isključiti obučavanje modela na njima?
Rizik od unošenja informacija u AI može se smanjiti i podešavanjem samog alata. Većina pružalaca usluga nudi mogućnost isključivanja korišćenja sadržaja za obučavanje modela.
- ChatGPT (OpenAI) – u podešavanjima naloga (Settings), u odeljku „Data controls”, nalazi se opcija „Improve the model for everyone”. Njenim isključivanjem sprečava se korišćenje unetih tekstova za obučavanje modela. U aktuelnoj verziji interfejsa razgovori pritom ostaju vidljivi u istoriji naloga. Nezavisno od tog podešavanja, OpenAI zadržava zapise na svojim serverima do 30 dana radi praćenja zloupotreba i bezbednosti, pre njihovog trajnog brisanja.
- Gemini (Google) – u podešavanjima privatnosti isključite „Gemini Apps Activity”. Novi razgovori se tada ne čuvaju na Google nalogu i ne koriste za obučavanje modela. To ipak ne znači da se zapisi odmah brišu iz infrastrukture pružaoca usluge: Google ih može zadržati do 72 sata radi bezbednosti usluge.
- Claude (Anthropic) – u besplatnim i standardnim potrošačkim verzijama trenutno se podrazumevano koristi uneti sadržaj za unapređenje modela. To je promena u odnosu na raniji period, kada je Anthropic isticao da ne koristi razgovore korisnika za obučavanje. Da biste to isključili, otvorite odeljak za privatnost u podešavanjima naloga i deaktivirajte opciju „Help improve Claude”.
Imajte u vidu da promene podešavanja privatnosti i isključivanje obučavanja važe samo za buduće interakcije. Time se ne uklanjaju informacije koje su ranije već upotrebljene u ciklusu obučavanja modela.
Rezime
- Svaki razgovor s potrošačkim AI alatom treba tretirati kao javnu objavu: ne unosite podatke o ličnosti, medicinsku dokumentaciju, lozinke niti poslovne tajne.
- Poslate informacije mogu proći kroz više faza obrade, uključujući obučavanje modela, moderaciju i čuvanje rezervnih kopija na spoljnim serverima.
- Rizik možete smanjiti prethodnom anonimizacijom, maskiranjem osetljivih nizova znakova, tokenizacijom i upotrebom DLP alata.
- Enterprise nalozi i namenski poslovni servisi u oblaku pružaju strože standarde zaštite i ugovorne garancije da se podaci klijenata ne koriste za obučavanje javnih modela.
- Promena podešavanja privatnosti i isključivanje obučavanja deluju samo ubuduće: ne uklanjaju podatke koji su već upotrebljeni za obučavanje modela.
Оставите одговор