Вибірка з того самого ймовірнісного розподілу
Багато організацій, зокрема U.S. Census, публічно випускають вибірки даних, які вони збирають про громадян. Перед цим набори даних анонімізують різними техніками, а потім усього лише 1%–5% вибірки публікують, щоб уможливити розрахунки. Відомо, що вибіркування зберігає статистичні характеристики даних і дає змогу вивчати та розуміти базову генеральну сукупність.
У цій вправі ви анонімізуєте стовпець department у наборі даних IBM HR, виконавши вибірку з розподілів початкового набору даних.
Набір даних завантажено як hr.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Отримайте відносні частоти кожного унікального значення в стовпці
department. - Витягніть імовірності з
countsі збережіть їх у зміннійdistributions. - Здійсніть вибірку з попередньо обчислених імовірнісних розподілів. Розмір вибірки має дорівнювати розміру набору даних
hr.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())