การ Normalization
ดังที่ได้กล่าวถึงในวิดีโอ การ normalization คือการปรับสเกลค่าทั้งคอลัมน์แบบเชิงเส้น ให้อยู่ในช่วง 0 ถึง 1 โดยค่าต่ำสุดในคอลัมน์จะถูกแทนด้วย 0 และค่าสูงสุดจะถูกแทนด้วย 1
เมื่อใช้ scikit-learn (ไลบรารี machine learning ที่ได้รับความนิยมมากที่สุดใน Python) สามารถใช้ MinMaxScaler เพื่อทำ normalization ได้
(ชื่อนี้มาจากการที่มันปรับสเกลค่าให้อยู่ระหว่างค่าต่ำสุดและค่าสูงสุดที่กำหนด)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
คำแนะนำการฝึกหัด
- Import
MinMaxScalerจากโมดูลpreprocessingของsklearn - สร้าง instance ของ
MinMaxScaler()โดยตั้งชื่อว่าMM_scaler - Fit
MinMaxScalerบนคอลัมน์Ageของso_numeric_df - Transform คอลัมน์เดียวกันด้วย scaler ที่เพิ่ง fit ไป
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import MinMaxScaler
____
# Instantiate MinMaxScaler
MM_scaler = ____()
# Fit MM_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_MM'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_MM', 'Age']].head())