Создание типа данных Object
Для быстрого анализа текста команда хочет представить название каждого фильма в виде множества (Python set) слов в нижнем регистре. Поскольку множество не является встроенным типом данных Polars, его нужно сохранить в столбце с типом pl.Object.
Датафрейм movies уже доступен, а вспомогательная функция title_to_word_set(title) определена заранее — она возвращает множество слов в нижнем регистре из названия фильма.
Это упражнение является частью курса
Масштабирование и оптимизация конвейеров данных с Polars
Инструкции к упражнению
- Примените
title_to_word_setк каждому значению в столбцеmovie_titleи сохраните полученные множества в новый столбец. - Задайте новому столбцу псевдоним
title_word_set.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
result = movies.with_columns(
pl.col("movie_title")
# Convert each title to a set of words
.____(title_to_word_set, return_dtype=pl.____)
.alias("____")
).select("movie_title", "title_word_set").head(8)
print(result)