Acest exercițiu face parte din cursul
Pregătește-te să aplici tehnici de anonimizare precum suprimarea datelor, mascarea, generarea de date sintetice și generalizarea. În acest capitol, vei învăța să faci distincția între informațiile de identificare personală (PII) sensibile și cele non-sensibile, să recunoști cvasi-identificatorii și să înțelegi elementele de bază ale GDPR. Vei întâlni și exemple din viața reală despre ce se poate întâmpla dacă nu respecți aceste bune practici.
Descoperă cum să anonimizezi date prin eșantionare din seturi de date care urmează distribuția de probabilitate a coloanelor. Vei învăța apoi să aplici modelul de confidențialitate k-anonimitate pentru a preveni atacurile de conectare sau re-identificare și să folosești ierarhii pentru a realiza generalizarea datelor în variabile categorice.
Află despre confidențialitatea diferențială, modelul folosit de companii tehnologice importante precum Apple, Google și Uber. În acest capitol, vei explora date prin generarea de histograme private și calcularea mediilor private. Vei crea și modele de învățare automată cu confidențialitate diferențială, care permit companiilor să crească utilitatea datelor lor.
Exercițiul curent
În acest capitol final, vei învăța să aplici metode de reducere a dimensionalității, precum analiza componentelor principale (PCA), pentru a anonimiza seturi de date mari cu multe coloane. Vei folosi apoi Faker pentru a genera seturi de date realiste și coerente, și scikit-learn pentru a crea seturi de date sintetice care urmează o distribuție normală. În final, vei combina toate tehnicile învățate în acest curs pentru a publica seturi de date în mod sigur.