Dela in strömmar i nivåer
Nu när du känner till popularitetsfördelningen vill ledningen kategorisera album efter totalt antal strömningar med hjälp av fasta tröskelvärden i stället för kvantiler. Det säkerställer att nivådefinitionerna förblir konsekventa när ny data tillkommer. Spotify-datamängden innehåller nu en kolumn streams_billions. Dela in album i tre nivåer med brytpunkter vid 2,5 och 4,0 miljarder strömningar.
polars är importerat som pl. DataFrame:en spotify är tillgänglig med en kolumn streams_billions.
Den här övningen är en del av kursen
Datatransformation med Polars
Övningsinstruktioner
- Dela in
streams_billionsi tre nivåer med brytpunkter vid2.5och4.0. - Lägg till den tredje etiketten
"blockbuster"för album med över 4,0 miljarder strömningar.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Bin streams_billions into three labeled bands
result = spotify.with_columns(
pl.col("streams_billions")
.____(
breaks=[____, ____],
labels=["emerging", "established", "____"],
)
.alias("stream_band")
)
print(result.head())