НачатьНачать бесплатно

Блокировка экспериментальных данных

Вы работаете с производственной компанией, которая хочет провести эксперименты по изучению производительности сотрудников. Их набор данных содержит всего 100 строк, поэтому важно, чтобы экспериментальные группы были сбалансированы.

Это отличная возможность применить знания о блокировке. Компания предоставила DataFrame productivity_subjects. Разделите этот набор данных на две равные группы по 50 записей в каждой.

Библиотеки numpy и pandas уже импортированы как np и pd соответственно.

Это упражнение является частью курса

Планирование экспериментов в Python

Посмотреть курс

Инструкции к упражнению

  • Случайным образом выберите 50 испытуемых из DataFrame productivity_subjects в новый DataFrame block_1 без возвращения.
  • Добавьте новый столбец block и установите для него значение 1 в DataFrame block_1.
  • Поместите оставшихся испытуемых в DataFrame block_2 и установите значение столбца block равным 2 для этого DataFrame.
  • Объедините оба блока в один DataFrame и выведите количество каждого значения в столбце block, чтобы убедиться, что блокировка выполнена корректно.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)

# Set the block column
block_1['block'] = ____

# Create second assignment and label
block_2 = ____
block_2['block'] = ____

# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())
Редактировать и запускать код