เตรียมข้อมูล RFM ก่อนการประมวลผล
เราโหลดชุดข้อมูลที่มีค่า RFM ซึ่งคุณคำนวณไว้ก่อนหน้านี้ในชื่อ datamart_rfm แล้ว เนื่องจากตัวแปรมีการกระจายที่เบ้และอยู่ในสเกลที่แตกต่างกัน ขั้นตอนนี้จะแก้ความเบ้และทำการ normalize ข้อมูล
ไลบรารี pandas โหลดไว้เป็น pd และ numpy เป็น np ลองสำรวจข้อมูลใน datamart_rfm ผ่าน console ก่อนได้เลย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การแบ่งกลุ่มลูกค้าด้วย Python
คำแนะนำการฝึกหัด
- ใช้การแปลงแบบ log transformation เพื่อแก้ความเบ้ของ
datamart_rfmแล้วเก็บผลลัพธ์ไว้ในชื่อdatamart_log - สร้าง instance ของ
StandardScaler()ในชื่อscalerแล้ว fit กับข้อมูลdatamart_log - แปลงข้อมูล
dataโดย scaling และ centering ด้วยscaler - สร้าง pandas DataFrame จาก
datamart_normalizedพร้อมกำหนด index และชื่อคอลัมน์จากdatamart_rfm
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Unskew the data
datamart_log = np.____(____)
# Initialize a standard scaler and fit it
scaler = ____()
scaler.____(____)
# Scale and center the data
datamart_normalized = ____.____(____)
# Create a pandas DataFrame
datamart_normalized = pd.____(data=____, index=____.index, columns=____.columns)