Bắt đầu ngayBắt đầu miễn phí

Tùy chỉnh chuẩn hóa theo phần trăm

Trong các slide, chúng ta đã minh họa cách chuẩn hóa dữ liệu về khoảng từ 0 đến 1. Đôi khi bạn sẽ muốn chuẩn hóa theo cách khác để phục vụ mục tiêu mô hình hóa hoặc hiển thị.

Bài tập này là một phần của khóa học

Feature Engineering với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tính giá trị lớn nhất và nhỏ nhất của DAYSONMARKET và gán vào biến max_daysmin_days, nhớ dùng collect() trên agg().
  • Dùng withColumn() tạo cột mới tên 'percentagescaleddays' dựa trên DAYSONMARKET.
  • percentage_scaled_days phải là cột số nguyên trong khoảng 0 đến 100, dùng round() để lấy số nguyên.
  • In max()min() cho cột mới percentage_scaled_days.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Chỉnh sửa và Chạy Mã