ПочатиПочніть безкоштовно

Вибірка з того самого ймовірнісного розподілу

Багато організацій, зокрема U.S. Census, публічно випускають вибірки даних, які вони збирають про громадян. Перед цим набори даних анонімізують різними техніками, а потім усього лише 1%–5% вибірки публікують, щоб уможливити розрахунки. Відомо, що вибіркування зберігає статистичні характеристики даних і дає змогу вивчати та розуміти базову генеральну сукупність.

У цій вправі ви анонімізуєте стовпець department у наборі даних IBM HR, виконавши вибірку з розподілів початкового набору даних.

Набір даних завантажено як hr.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інструкції до вправи

  • Отримайте відносні частоти кожного унікального значення в стовпці department.
  • Витягніть імовірності з counts і збережіть їх у змінній distributions.
  • Здійсніть вибірку з попередньо обчислених імовірнісних розподілів. Розмір вибірки має дорівнювати розміру набору даних hr.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
Редагувати та запускати код