Блокування експериментальних даних
Ви працюєте з виробничою компанією, яка хоче провести експерименти щодо продуктивності працівників. Їхній набір даних містить лише 100 рядків, тож важливо, щоб експериментальні групи були збалансовані.
Це чудова нагода застосувати знання про блокування. Вони надали датафрейм productivity_subjects. Розбийте наданий набір даних на дві рівні групи по 50 записів у кожній.
Бібліотеки numpy та pandas імпортовано відповідно як np і pd.
Ця вправа є частиною курсу
Експериментальний дизайн у Python
Інструкції до вправи
- Випадково виберіть 50 учасників із датафрейму
productivity_subjectsдо нового датафреймуblock_1без повернення елементів у вибірку. - Додайте новий стовпець
blockзі значенням 1 для датафреймуblock_1. - Передайте решту учасників до датафрейму
block_2і встановіть у ньому значення стовпцяblockрівним 2. - Об'єднайте обидва блоки в один датафрейм і виведіть кількість кожного значення у стовпці
block, щоб переконатися, що блокування спрацювало.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())