Gán đối tượng không ngẫu nhiên
Một công ty nông nghiệp đang thực hiện thí nghiệm để đo lường việc cho cừu ăn các loại cỏ khác nhau ảnh hưởng đến cân nặng của chúng như thế nào. Họ nhờ bạn hỗ trợ thiết lập thí nghiệm cho đúng. Một quản lý của họ nói rằng bạn có thể phân bổ đối tượng bằng cách lấy 250 hàng đầu tiên từ DataFrame là được.
Nhiệm vụ của bạn là dùng kỹ năng phân tích để chứng minh vì sao cách này có thể không ổn. Hãy gán các đối tượng vào hai nhóm bằng cách gán không ngẫu nhiên (250 hàng đầu tiên) và quan sát sự khác biệt trong các thống kê mô tả.
Bạn đã nhận được DataFrame weights có một cột chứa weight của cừu và một cột id duy nhất.
numpy và pandas đã được nhập lần lượt là np và pd.
Bài tập này là một phần của khóa học
Thiết kế thí nghiệm với Python
Hướng dẫn bài tập
- Dùng slicing trên DataFrame để đưa 250 hàng đầu tiên của
weightsvàogroup1_non_randvà phần còn lại vàogroup2_non_rand. - Tạo thống kê mô tả cho hai nhóm và nối chúng thành một DataFrame duy nhất.
- In ra để quan sát sự khác biệt.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Non-random assignment
group1_non_rand = ____
group2_non_rand = ____
# Compare descriptive statistics of groups
compare_df_non_rand = ____([group1_non_rand['weight'].____, group2_non_rand['weight'].____], axis=1)
compare_df_non_rand.columns = ['group1', 'group2']
# Print to assess
print(____)