Выборка из того же вероятностного распределения
Многие организации, в том числе Бюро переписи населения США, публично публикуют выборки данных, собранных о частных лицах. Сначала такие наборы данных анонимизируются с помощью различных методов, а затем публикуется небольшая часть — от 1% до 5% от общего объёма — для проведения вычислений. Выборка позволяет сохранить статистические характеристики данных, что даёт возможность изучать и анализировать генеральную совокупность.
В этом упражнении вы анонимизируете столбец department из набора данных IBM HR, выполнив выборку на основе распределений исходного набора данных.
Набор данных загружен в переменную hr.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Получите относительные частоты для каждого уникального значения в столбце
department. - Извлеките вероятности из
countsи сохраните их в переменнуюdistributions. - Выполните выборку на основе ранее вычисленных вероятностных распределений. Размер выборки должен совпадать с размером набора данных
hr.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())