CommencezCommencez gratuitement

Mise à l'échelle personnalisée en pourcentage

Dans le diaporama, nous avons montré comment mettre les données à l'échelle entre 0 et 1. Parfois, vous pourriez vouloir une autre mise à l'échelle pour les besoins du modèle ou de l'affichage.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Calculez les valeurs max et min de DAYSONMARKET et placez-les dans les variables max_days et min_days. N'oubliez pas d'utiliser collect() sur agg().
  • Avec withColumn(), créez une nouvelle colonne nommée 'percentagescaleddays' à partir de DAYSONMARKET.
  • percentage_scaled_days doit être une colonne d'entiers allant de 0 à 100; utilisez round() pour obtenir des entiers.
  • Affichez le max() et le min() de la nouvelle colonne percentage_scaled_days.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
Modifier et exécuter le code