НачатьНачать бесплатно

Создание типа данных Object

Для быстрого анализа текста команда хочет представить название каждого фильма в виде множества (Python set) слов в нижнем регистре. Поскольку множество не является встроенным типом данных Polars, его нужно сохранить в столбце с типом pl.Object.

Датафрейм movies уже доступен, а вспомогательная функция title_to_word_set(title) определена заранее — она возвращает множество слов в нижнем регистре из названия фильма.

Это упражнение является частью курса

Масштабирование и оптимизация конвейеров данных с Polars

Посмотреть курс

Инструкции к упражнению

  • Примените title_to_word_set к каждому значению в столбце movie_title и сохраните полученные множества в новый столбец.
  • Задайте новому столбцу псевдоним title_word_set.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

result = movies.with_columns(
    pl.col("movie_title")
    # Convert each title to a set of words
    .____(title_to_word_set, return_dtype=pl.____)
    .alias("____")
).select("movie_title", "title_word_set").head(8)
print(result)
Редактировать и запускать код