Kom igångKom igång gratis

Anpassad procentuell skalning

I slides visade vi hur man skalar data mellan 0 och 1. Ibland kan det vara användbart att skala data på ett annat sätt – för modellering eller visningssyften.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Beräkna max- och minvärdet för DAYSONMARKET och spara dem i variablerna max_days och min_days. Glöm inte att använda collect()agg().
  • Använd withColumn() för att skapa en ny kolumn som heter 'percentagescaleddays', baserad på DAYSONMARKET.
  • percentage_scaled_days ska innehålla heltal från 0 till 100 – använd round() för att få heltal.
  • Skriv ut max() och min() för den nya kolumnen percentage_scaled_days.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Redigera och kör kod