ПочатиПочніть безкоштовно

Дослідіть розподіл даних

Коли ми хочемо анонімізувати набір даних, відбираючи записи максимально реалістично, нам потрібно мати певні предметні знання та розуміти статистичні властивості даних. Як ми бачили, ключове значення має знаходження ймовірнісного розподілу для потрібного стовпця.

У цій вправі ви дослідите стовпець business_travel зі спрощеної версії набору даних IBM HR.

Датафрейм уже імпортовано як hr, а numpy — як np. Як зазначалося в попередньому розділі, pandas імпортовано як pd для цього та решти курсу.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the absolute frequencies of each unique value
print(____)
Редагувати та запускати код