Створення типу даних Object
Для разового дослідження тексту команді потрібна назва кожного фільму у вигляді множини слів у нижньому регістрі (Python set). Множина не є вбудованим типом даних Polars, тож збережіть її в стовпці з типом pl.Object.
Датафрейм movies доступний, а допоміжна функція title_to_word_set(title) уже визначена й повертає множину слів у нижньому регістрі з назви.
Ця вправа є частиною курсу
Масштабування й оптимізація конвеєрів даних з Polars
Інструкції до вправи
- Запустіть
title_to_word_setдля кожногоmovie_titleі збережіть повернуті множини Python у новому стовпці. - Додайте псевдонім для нового стовпця як
title_word_set.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
result = movies.with_columns(
pl.col("movie_title")
# Convert each title to a set of words
.____(title_to_word_set, return_dtype=pl.____)
.alias("____")
).select("movie_title", "title_word_set").head(8)
print(result)