Изучение распределения данных
Когда мы хотим анонимизировать набор данных, выбирая данные максимально реалистичным способом, нам нужно получить определённые предметные и статистические знания о данных. Как мы уже видели, ключевым шагом является нахождение вероятностного распределения интересующего столбца.
В этом упражнении вы исследуете столбец business_travel из упрощённой версии набора данных IBM HR.
DataFrame импортирован как hr, а numpy — как np. Как было отмечено в предыдущей главе, pandas импортирован как pd — это справедливо для данного и всех последующих упражнений курса.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the absolute frequencies of each unique value
print(____)