Explorer la distribution des données
Quand on veut anonymiser un jeu de données en échantillonnant de façon très réaliste, il faut bien comprendre le domaine et avoir des notions statistiques sur les données. Comme nous l'avons vu, déterminer la loi de probabilité de la colonne qui nous intéresse est essentiel.
Dans cet exercice, vous allez explorer la colonne business_travel à partir d'une version simplifiée du jeu de données IBM HR.
Le DataFrame a été importé sous le nom hr et numpy sous np. Comme mentionné au chapitre précédent, pandas a été importé sous pd pour cet exercice et pour le reste du cours.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the absolute frequencies of each unique value
print(____)