Inizia subitoInizia gratis

Scalatura personalizzata in percentuale

Nelle diapositive abbiamo mostrato come scalare i dati tra 0 e 1. A volte potresti voler scalare in modo diverso per esigenze di modellazione o di visualizzazione.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Calcola il massimo e il minimo di DAYSONMARKET e assegnali alle variabili max_days e min_days; non dimenticare di usare collect() su agg().
  • Usando withColumn() crea una nuova colonna chiamata 'percentagescaleddays' basata su DAYSONMARKET.
  • percentage_scaled_days deve essere una colonna di interi da 0 a 100; usa round() per ottenere interi.
  • Stampa il max() e il min() della nuova colonna percentage_scaled_days.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Modifica ed esegui il codice