Mise à l’échelle personnalisée en pourcentage
Dans le diaporama, nous avons montré comment mettre les données à l’échelle entre 0 et 1. Parfois, vous pouvez vouloir une autre échelle pour les besoins du modèle ou de l’affichage.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Calculez le max et le min de
DAYSONMARKETet stockez-les dans les variablesmax_daysetmin_days. N’oubliez pas d’utilisercollect()suragg(). - Avec
withColumn(), créez une nouvelle colonne appelée 'percentagescaleddays' à partir deDAYSONMARKET. percentage_scaled_daysdoit être une colonne d’entiers allant de 0 à 100 ; utilisezround()pour obtenir des entiers.- Affichez le
max()et lemin()de la nouvelle colonnepercentage_scaled_days.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())