Anpassad procentuell skalning
I slides visade vi hur man skalar data mellan 0 och 1. Ibland kan det vara användbart att skala data på ett annat sätt – för modellering eller visningssyften.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Beräkna max- och minvärdet för
DAYSONMARKEToch spara dem i variablernamax_daysochmin_days. Glöm inte att användacollect()påagg(). - Använd
withColumn()för att skapa en ny kolumn som heter 'percentagescaleddays', baserad påDAYSONMARKET. percentage_scaled_daysska innehålla heltal från 0 till 100 – användround()för att få heltal.- Skriv ut
max()ochmin()för den nya kolumnenpercentage_scaled_days.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())