Дослідіть розподіл даних
Коли ми хочемо анонімізувати набір даних, відбираючи записи максимально реалістично, нам потрібно мати певні предметні знання та розуміти статистичні властивості даних. Як ми бачили, ключове значення має знаходження ймовірнісного розподілу для потрібного стовпця.
У цій вправі ви дослідите стовпець business_travel зі спрощеної версії набору даних IBM HR.
Датафрейм уже імпортовано як hr, а numpy — як np. Як зазначалося в попередньому розділі, pandas імпортовано як pd для цього та решти курсу.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the absolute frequencies of each unique value
print(____)