การแปลงข้อมูล Training แบบ Lazy
การปรับแต่งตัวแปร input เป็นขั้นตอนสำคัญใน machine learning และมักช่วยเพิ่มความแม่นยำของโมเดลที่สร้างขึ้น ในแบบฝึกหัดก่อนหน้า ข้อมูล Spotify ถูกปรับแต่งไว้ให้แล้ว แต่สิ่งสำคัญคือต้องรู้วิธีทำเองได้
ในแบบฝึกหัดนี้ จะใช้ออบเจกต์ StandardScaler() เพื่อแปลงคอลัมน์ของอาร์เรย์ให้มีค่าเฉลี่ยเป็นศูนย์และส่วนเบี่ยงเบนมาตรฐานเป็นหนึ่ง
Dask DataFrame ของเพลง Spotify พร้อมใช้งานในสภาพแวดล้อมของคุณในชื่อ dask_df ซึ่งประกอบด้วยทั้งคะแนนความนิยม (target) และตัวแปร input ที่ใช้ในการทำนายคะแนนเหล่านั้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Parallel Programming with Dask in Python
คำแนะนำการฝึกหัด
- Import คลาส
StandardScaler()จากdask_ml.preprocessing - เลือกคอลัมน์
'popularity'จาก DataFrame และกำหนดให้กับตัวแปรy - สร้างออบเจกต์
StandardScalerและ fit กับข้อมูลX - ใช้ scaler แปลงข้อมูล
X
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)