เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การปรับสเกลข้อมูล

สำหรับอัลกอริทึม ML ที่ใช้เมตริกแบบระยะทาง การปรับสเกลข้อมูลเป็นสิ่งสำคัญมากที่ต้องทำเสมอ เนื่องจาก feature ที่มีสเกลต่างกันจะทำให้ผลลัพธ์คลาดเคลื่อน K-means ใช้ระยะทาง Euclidean ในการวัดระยะห่างจาก cluster centroid ดังนั้นจึงต้องปรับสเกลข้อมูลก่อนนำไปใช้กับอัลกอริทึม

Dataframe df จากแบบฝึกหัดก่อนหน้าพร้อมใช้งานแล้ว โดยผ่านการเตรียมข้อมูลเบื้องต้นให้พร้อมสำหรับ sklearn label ของการฉ้อโกงถูกเก็บแยกไว้ใน labels ซึ่งสามารถนำมาตรวจสอบผลลัพธ์ภายหลังได้ และได้ import numpy ในชื่อ np ไว้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจจับการฉ้อโกงด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import MinMaxScaler
  • แปลง dataframe df เป็น numpy array ชื่อ X โดยดึงเฉพาะค่าจาก df และตรวจสอบให้แน่ใจว่าทุกค่าเป็นชนิด float
  • นำ scaler ที่กำหนดไว้ไปใช้กับ X เพื่อให้ได้ค่าที่ปรับสเกลแล้วใน X_scaled โดยบังคับให้ทุก feature อยู่ในช่วง 0-1

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
แก้ไขและรันโค้ด