EmpezarEmpieza gratis

Escalado porcentual personalizado

En las diapositivas mostramos cómo escalar los datos entre 0 y 1. A veces quizá quieras escalarlos de otra forma para fines de modelado o visualización.

Este ejercicio forma parte del curso

Ingeniería de características con PySpark

Ver curso

Instrucciones del ejercicio

  • Calcula el máximo y mínimo de DAYSONMARKET y guárdalos en las variables max_days y min_days; no olvides usar collect() sobre agg().
  • Usando withColumn(), crea una nueva columna llamada 'percentagescaleddays' basada en DAYSONMARKET.
  • percentage_scaled_days debe ser una columna de enteros entre 0 y 100; usa round() para obtener enteros.
  • Imprime el max() y el min() de la nueva columna percentage_scaled_days.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Editar y ejecutar código