Construiește un clasificator cu confidențialitate diferențială
În acest exercițiu, vei construi și antrena un model privat Gaussian Naive Bayes pe setul de date Penguin, pentru a clasifica dacă un pinguin este mascul sau femelă.
K-anonimitatea nu funcționează bine cu seturi de date de mari dimensiuni sau diverse, din cauza limitărilor sale teoretice și empirice semnificative – fenomenul cunoscut drept „blestemul dimensionalității". Pe măsură ce numărul de caracteristici sau dimensiuni crește, cantitatea de date necesară pentru o generalizare precisă crește exponențial. Acesta este unul dintre motivele pentru care confidențialitatea diferențială este în prezent modelul de confidențialitate preferat. Epsilon este independent de orice cunoștințe prealabile și „delimitează" informațiile sensibile.
DataFrame-ul este încărcat ca penguin_df și împărțit în X_train, y_train, X_test și y_test. Clasa modelului privat a fost importată ca dp_GaussianNB.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Instrucțiuni pentru exercițiu
- Creează un clasificator
dp_GaussianNBfără parametri. - Antrenează modelul creat anterior pe date, fără niciun parametru.
- Calculează scorul modelului privat pe baza datelor de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))