Regrouper les écoutes en paliers
Maintenant que vous connaissez la distribution de popularité, la direction souhaite catégoriser les albums par nombre total d’écoutes en utilisant des seuils fixes plutôt que des quantiles. Cela garantit que les définitions des paliers restent cohérentes à mesure que de nouvelles données arrivent. Le jeu de données Spotify inclut désormais une colonne streams_billions. Regroupez les albums en trois paliers avec des coupures à 2,5 et 4,0 milliards d’écoutes.
polars est importé sous le nom pl. Le DataFrame spotify est disponible avec une colonne streams_billions.
Cet exercice fait partie du cours
<cours>Transformation de données avec Polars</cours>Instructions de l’exercice
- Regroupez
streams_billionsen trois paliers avec des coupures à2.5et4.0. - Ajoutez le troisième libellé
"blockbuster"pour les albums au-dessus de 4,0 milliards d’écoutes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Bin streams_billions into three labeled bands
result = spotify.with_columns(
pl.col("streams_billions")
.____(
breaks=[____, ____],
labels=["emerging", "established", "____"],
)
.alias("stream_band")
)
print(result.head())