Tùy chỉnh chuẩn hóa theo phần trăm
Trong các slide, chúng ta đã minh họa cách chuẩn hóa dữ liệu về khoảng từ 0 đến 1. Đôi khi bạn sẽ muốn chuẩn hóa theo cách khác để phục vụ mục tiêu mô hình hóa hoặc hiển thị.
Bài tập này là một phần của khóa học
Feature Engineering với PySpark
Hướng dẫn bài tập
- Tính giá trị lớn nhất và nhỏ nhất của
DAYSONMARKETvà gán vào biếnmax_daysvàmin_days, nhớ dùngcollect()trênagg(). - Dùng
withColumn()tạo cột mới tên 'percentagescaleddays' dựa trênDAYSONMARKET. percentage_scaled_daysphải là cột số nguyên trong khoảng 0 đến 100, dùnground()để lấy số nguyên.- In
max()vàmin()cho cột mớipercentage_scaled_days.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())