Scalare procentuală personalizată
În slide-uri am arătat cum să scalezi datele între 0 și 1. Uneori poate fi util să scalezi datele diferit, în funcție de scopul modelării sau al afișării.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Calculează maximul și minimul coloanei
DAYSONMARKETși stochează-le în variabilelemax_daysșimin_days— nu uita să foloseșticollect()peagg(). - Folosind
withColumn(), creează o coloană nouă numită'percentage_scaled_days'bazată peDAYSONMARKET. percentage_scaled_daystrebuie să conțină valori întregi între 0 și 100 — foloseșteround()pentru a obține numere întregi.- Afișează valorile
max()șimin()pentru noua coloanăpercentage_scaled_days.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())