Extrakce hlavního žánru
Právě ses přidal/a k datovému týmu filmového streamovacího startupu. Metadata filmů jsou uložena v souboru Parquet, kde má každý film sloupec genres jako seznam řetězců – většina filmů totiž spadá do více žánrů. Tvým úkolem je vytáhnout první uvedený žánr z každého řádku do přehledného sloupce primary_genre na nejvyšší úrovni.
polars je načten jako pl a DataFrame movies je předem načten z Parquet souboru.
Toto cvičení je součástí kurzu
Scaling and Optimizing Data Pipelines with Polars
Pokyny k cvičení
- Z
genressloupce každého řádku extrahuj první prvek pomocí výrazu pro práci se seznamy. - Nový sloupec pojmenuj pomocí aliasu
primary_genre.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
result = movies.select(
"movie_title",
"genres",
# Get the first genre
pl.col("genres").list.____(0).alias("____"),
).head(8)
print(result)