ПочатиПочніть безкоштовно

Кастомне масштабування у відсотках

На слайдах ми показали, як масштабувати дані в діапазоні від 0 до 1. Інколи для моделювання або відображення може знадобитися інше масштабування.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Обчисліть максимум і мінімум DAYSONMARKET та збережіть їх у змінні max_days і min_days. Не забудьте застосувати collect() до результату agg().
  • Використовуючи withColumn(), створіть новий стовпець під назвою 'percentagescaleddays' на основі DAYSONMARKET.
  • percentage_scaled_days має бути стовпцем цілих чисел у діапазоні від 0 до 100. Використайте round(), щоб отримати цілі значення.
  • Виведіть max() і min() для нового стовпця percentage_scaled_days.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Редагувати та запускати код