ค่าเฉลี่ยของค่าเฉลี่ย
เราต้องการทราบว่าจำนวนผู้ใช้เฉลี่ย (num_users) ต่อดีลคือเท่าใด โดยต้องการข้อมูลในระดับบริษัททั้งหมดเพื่อเปรียบเทียบว่าดีลของ Amir มีผู้ใช้มากกว่าหรือน้อยกว่าค่าเฉลี่ยของบริษัท ปัญหาคือในช่วงปีที่ผ่านมา บริษัทมีดีลมากกว่าหนึ่งหมื่นรายการ จึงไม่สามารถรวบรวมข้อมูลทั้งหมดได้จริง แนวทางแก้ไขคือการประมาณค่าเฉลี่ยด้วยการสุ่มตัวอย่างดีลหลายชุด ซึ่งทำได้ง่ายกว่าการเก็บข้อมูลจากทุกคนในบริษัทมาก
amir_deals พร้อมใช้งานแล้ว และข้อมูลผู้ใช้สำหรับดีลทั้งหมดของบริษัทอยู่ใน all_deals โดยได้โหลด pandas เป็น pd และ numpy เป็น np ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
สถิติเบื้องต้นด้วย Python
คำแนะนำการฝึกหัด
- กำหนด random seed เป็น
321 - สุ่มตัวอย่าง 30 ชุด (แบบมีการคืน) ขนาดชุดละ 20 จาก
all_deals['num_users']แล้วคำนวณค่าเฉลี่ยของแต่ละชุด จากนั้นเก็บค่าเฉลี่ยทั้งหมดไว้ในsample_means - พิมพ์ค่าเฉลี่ยของ
sample_means - พิมพ์ค่าเฉลี่ยของคอลัมน์
num_usersจากamir_deals
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Set seed to 321
____
sample_means = []
# Loop 30 times to take 30 means
for i in range(____):
# Take sample of size 20 from num_users col of all_deals with replacement
cur_sample = ____
# Take mean of cur_sample
cur_mean = ____
# Append cur_mean to sample_means
sample_means.append(____)
# Print mean of sample_means
print(____)
# Print mean of num_users in amir_deals
print(____)