CommencerCommencez gratuitement

Regrouper les écoutes en paliers

Maintenant que vous connaissez la distribution de popularité, la direction souhaite catégoriser les albums par nombre total d’écoutes en utilisant des seuils fixes plutôt que des quantiles. Cela garantit que les définitions des paliers restent cohérentes à mesure que de nouvelles données arrivent. Le jeu de données Spotify inclut désormais une colonne streams_billions. Regroupez les albums en trois paliers avec des coupures à 2,5 et 4,0 milliards d’écoutes.

polars est importé sous le nom pl. Le DataFrame spotify est disponible avec une colonne streams_billions.

Cet exercice fait partie du cours

<cours>Transformation de données avec Polars</cours>
Voir le cours

Instructions de l’exercice

  • Regroupez streams_billions en trois paliers avec des coupures à 2.5 et 4.0.
  • Ajoutez le troisième libellé "blockbuster" pour les albums au-dessus de 4,0 milliards d’écoutes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Bin streams_billions into three labeled bands
result = spotify.with_columns(
    pl.col("streams_billions")
    .____(
        breaks=[____, ____],
        labels=["emerging", "established", "____"],
    )
    .alias("stream_band")
)

print(result.head())
Modifier et exécuter le code