ÎncepețiÎncepe gratuit

Scalare procentuală personalizată

În slide-uri am arătat cum să scalezi datele între 0 și 1. Uneori poate fi util să scalezi datele diferit, în funcție de scopul modelării sau al afișării.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează maximul și minimul coloanei DAYSONMARKET și stochează-le în variabilele max_days și min_days — nu uita să folosești collect() pe agg().
  • Folosind withColumn(), creează o coloană nouă numită 'percentage_scaled_days' bazată pe DAYSONMARKET.
  • percentage_scaled_days trebuie să conțină valori întregi între 0 și 100 — folosește round() pentru a obține numere întregi.
  • Afișează valorile max() și min() pentru noua coloană percentage_scaled_days.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Editează și rulează codul