Escalado porcentual personalizado
En las diapositivas mostramos cómo escalar los datos entre 0 y 1. A veces quizá quieras escalarlos de otra forma para fines de modelado o visualización.
Este ejercicio forma parte del curso
Ingeniería de características con PySpark
Instrucciones del ejercicio
- Calcula el máximo y mínimo de
DAYSONMARKETy guárdalos en las variablesmax_daysymin_days; no olvides usarcollect()sobreagg(). - Usando
withColumn(), crea una nueva columna llamada 'percentagescaleddays' basada enDAYSONMARKET. percentage_scaled_daysdebe ser una columna de enteros entre 0 y 100; usaround()para obtener enteros.- Imprime el
max()y elmin()de la nueva columnapercentage_scaled_days.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())