การบล็อกข้อมูลเชิงทดลอง
คุณกำลังทำงานร่วมกับบริษัทผู้ผลิตแห่งหนึ่งที่ต้องการทำการทดลองเกี่ยวกับผลิตภาพของพนักงาน ชุดข้อมูลของพวกเขามีเพียง 100 แถว ดังนั้นจึงสำคัญมากที่กลุ่มทดลองต้องมีขนาดสมดุลกัน
นี่เป็นโอกาสดีที่จะนำความรู้เรื่องการบล็อกมาช่วยพวกเขา โดยมี DataFrame ชื่อ productivity_subjects ให้แล้ว ให้แบ่งชุดข้อมูลออกเป็นสองกลุ่มเท่าๆ กัน กลุ่มละ 50 รายการ
ไลบรารี numpy และ pandas ถูก import มาแล้วในชื่อ np และ pd ตามลำดับ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การออกแบบการทดลองด้วย Python
คำแนะนำการฝึกหัด
- สุ่มเลือก 50 รายการจาก DataFrame
productivity_subjectsไปยัง DataFrame ใหม่ชื่อblock_1โดยไม่มีการเลือกซ้ำ - สร้างคอลัมน์ใหม่ชื่อ
blockและกำหนดค่าเป็น 1 สำหรับ DataFrameblock_1 - กำหนดรายการที่เหลือให้กับ DataFrame ชื่อ
block_2และตั้งค่าคอลัมน์blockเป็น 2 สำหรับ DataFrame นี้ - เชื่อมทั้งสองบล็อกเข้าด้วยกันเป็น DataFrame เดียว จากนั้นพิมพ์จำนวนของแต่ละค่าในคอลัมน์
blockเพื่อยืนยันว่าการบล็อกทำงานถูกต้อง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Randomly assign half
block_1 = productivity_subjects.____(____, random_state=42, ____)
# Set the block column
block_1['block'] = ____
# Create second assignment and label
block_2 = ____
block_2['block'] = ____
# Concatenate and print
productivity_combined = pd.____([block_1, block_2], axis=0)
print(productivity_combined['block'].value_counts())