Кастомне масштабування у відсотках
На слайдах ми показали, як масштабувати дані в діапазоні від 0 до 1. Інколи для моделювання або відображення може знадобитися інше масштабування.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Обчисліть максимум і мінімум
DAYSONMARKETта збережіть їх у змінніmax_daysіmin_days. Не забудьте застосуватиcollect()до результатуagg(). - Використовуючи
withColumn(), створіть новий стовпець під назвою 'percentagescaleddays' на основіDAYSONMARKET. percentage_scaled_daysмає бути стовпцем цілих чисел у діапазоні від 0 до 100. Використайтеround(), щоб отримати цілі значення.- Виведіть
max()іmin()для нового стовпцяpercentage_scaled_days.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())