Нерандомизированное распределение испытуемых
Сельскохозяйственная компания проводит эксперимент, чтобы выяснить, как различные виды корма влияют на вес овец. Вас попросили помочь с правильной организацией эксперимента. Один из менеджеров предложил сформировать группы испытуемых, просто взяв первые 250 строк из DataFrame — по его мнению, этого достаточно.
Ваша задача — с помощью аналитических инструментов показать, почему такой подход может быть ненадёжным. Распределите испытуемых на две группы без рандомизации (первые 250 строк) и сравните описательные статистики обеих групп.
Вам предоставлен DataFrame weights со столбцом weight, содержащим вес овец, и столбцом уникальных идентификаторов id.
Библиотеки numpy и pandas уже импортированы как np и pd соответственно.
Это упражнение является частью курса
Планирование экспериментов в Python
Инструкции к упражнению
- С помощью срезов DataFrame поместите первые 250 строк из
weightsвgroup1_non_rand, а оставшиеся — вgroup2_non_rand. - Рассчитайте описательные статистики для обеих групп и объедините их в один DataFrame.
- Выведите результат на экран и сравните значения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Non-random assignment
group1_non_rand = ____
group2_non_rand = ____
# Compare descriptive statistics of groups
compare_df_non_rand = ____([group1_non_rand['weight'].____, group2_non_rand['weight'].____], axis=1)
compare_df_non_rand.columns = ['group1', 'group2']
# Print to assess
print(____)