Aan de slagBegin gratis

Aangepaste percentageschaal

In de dia's lieten we zien hoe je data schaalt tussen 0 en 1. Soms wil je dingen anders schalen voor modeling- of weergavedoeleinden.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Bereken de max en min van DAYSONMARKET en zet ze in de variabelen max_days en min_days. Vergeet niet collect() te gebruiken op agg().
  • Maak met withColumn() een nieuwe kolom met de naam 'percentagescaleddays' op basis van DAYSONMARKET.
  • percentage_scaled_days moet een kolom met gehele getallen van 0 tot 100 zijn; gebruik round() om gehele getallen te krijgen.
  • Print de max() en min() voor de nieuwe kolom percentage_scaled_days.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Code bewerken en uitvoeren