Блокировка экспериментальных данных
Вы работаете с производственной компанией, которая хочет провести эксперименты по изучению производительности сотрудников. Их набор данных содержит всего 100 строк, поэтому важно, чтобы экспериментальные группы были сбалансированы.
Это отличная возможность применить знания о блокировке. Компания предоставила DataFrame productivity_subjects. Разделите этот набор данных на две равные группы по 50 записей в каждой.
Библиотеки numpy и pandas уже импортированы как np и pd соответственно.
Это упражнение является частью курса
Планирование экспериментов в Python
Инструкции к упражнению
- Случайным образом выберите 50 испытуемых из DataFrame
productivity_subjectsв новый DataFrameblock_1без возвращения. - Добавьте новый столбец
blockи установите для него значение 1 в DataFrameblock_1. - Поместите оставшихся испытуемых в DataFrame
block_2и установите значение столбцаblockравным 2 для этого DataFrame. - Объедините оба блока в один DataFrame и выведите количество каждого значения в столбце
block, чтобы убедиться, что блокировка выполнена корректно.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())