НачатьНачать бесплатно

Изучение распределения данных

Когда мы хотим анонимизировать набор данных, выбирая данные максимально реалистичным способом, нам нужно получить определённые предметные и статистические знания о данных. Как мы уже видели, ключевым шагом является нахождение вероятностного распределения интересующего столбца.

В этом упражнении вы исследуете столбец business_travel из упрощённой версии набора данных IBM HR.

DataFrame импортирован как hr, а numpy — как np. Как было отмечено в предыдущей главе, pandas импортирован как pd — это справедливо для данного и всех последующих упражнений курса.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the absolute frequencies of each unique value
print(____)
Редактировать и запускать код