CommencezCommencez gratuitement

Créer un classificateur différentiellement privé

Dans cet exercice, vous allez créer et entraîner un modèle privé Gaussian Naive Bayes sur l'ensemble de données Penguin afin de classer si un manchot est mâle ou femelle.

La k-anonymité fonctionne mal avec des ensembles de données à forte dimensionnalité ou très variés en raison de ses limites théoriques et empiriques importantes, la « malédiction de la dimensionnalité ». Lorsque le nombre de caractéristiques ou de dimensions augmente, la quantité de données nécessaire pour généraliser avec précision croît de façon exponentielle. C'est l'une des raisons pour lesquelles la differential privacy est aujourd'hui le modèle de confidentialité privilégié. Epsilon est indépendant de toute connaissance préalable et « borne » l'information sensible.

Le DataFrame est chargé sous le nom penguin_df et scindé en X_train, y_train, X_test et y_test. La classe du modèle privé a été importée sous le nom dp_GaussianNB.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Instructions de l’exercice

  • Créez un classificateur dp_GaussianNB sans paramètres.
  • Entraînez le modèle créé précédemment sur les données sans aucun paramètre.
  • Calculez le pointage du modèle privé à partir des données de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Built the private classifier without parameters
dp_clf = ____

# Fit the model to the data
____(X_train, y_train)

# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))
Modifier et exécuter le code