Mise à l'échelle personnalisée en pourcentage
Dans le diaporama, nous avons montré comment mettre les données à l'échelle entre 0 et 1. Parfois, vous pourriez vouloir une autre mise à l'échelle pour les besoins du modèle ou de l'affichage.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Calculez les valeurs max et min de
DAYSONMARKETet placez-les dans les variablesmax_daysetmin_days. N'oubliez pas d'utilisercollect()suragg(). - Avec
withColumn(), créez une nouvelle colonne nommée 'percentagescaleddays' à partir deDAYSONMARKET. percentage_scaled_daysdoit être une colonne d'entiers allant de 0 à 100; utilisezround()pour obtenir des entiers.- Affichez le
max()et lemin()de la nouvelle colonnepercentage_scaled_days.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())