การปรับสเกลข้อมูล
สำหรับอัลกอริทึม ML ที่ใช้เมตริกแบบระยะทาง การปรับสเกลข้อมูลเป็นสิ่งสำคัญมากที่ต้องทำเสมอ เนื่องจาก feature ที่มีสเกลต่างกันจะทำให้ผลลัพธ์คลาดเคลื่อน K-means ใช้ระยะทาง Euclidean ในการวัดระยะห่างจาก cluster centroid ดังนั้นจึงต้องปรับสเกลข้อมูลก่อนนำไปใช้กับอัลกอริทึม
Dataframe df จากแบบฝึกหัดก่อนหน้าพร้อมใช้งานแล้ว โดยผ่านการเตรียมข้อมูลเบื้องต้นให้พร้อมสำหรับ sklearn label ของการฉ้อโกงถูกเก็บแยกไว้ใน labels ซึ่งสามารถนำมาตรวจสอบผลลัพธ์ภายหลังได้ และได้ import numpy ในชื่อ np ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- Import
MinMaxScaler - แปลง dataframe
dfเป็น numpy array ชื่อXโดยดึงเฉพาะค่าจากdfและตรวจสอบให้แน่ใจว่าทุกค่าเป็นชนิดfloat - นำ scaler ที่กำหนดไว้ไปใช้กับ
Xเพื่อให้ได้ค่าที่ปรับสเกลแล้วในX_scaledโดยบังคับให้ทุก feature อยู่ในช่วง 0-1
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)