НачатьНачать бесплатно

TF-IDF сюжетов фильмов

Воспользуемся сюжетами случайно выбранных фильмов для кластеризации документов. Перед тем как приступить к кластеризации, тексты необходимо очистить от нежелательного шума (специальных символов и стоп-слов) и преобразовать в разреженную матрицу с помощью TF-IDF.

Применит класс TfidfVectorizer для вычисления TF-IDF сюжетов фильмов, хранящихся в списке plots. Функция remove_noise() доступна для использования в качестве параметра tokenizer в классе TfidfVectorizer. Метод .fit_transform() обучает объект TfidfVectorizer на данных и формирует разреженную матрицу TF-IDF.

Примечание: выполнение метода .fit_transform() может занять несколько секунд.

Это упражнение является частью курса

Кластерный анализ на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс TfidfVectorizer из библиотеки sklearn.
  • Инициализируйте класс TfidfVectorizer, задав минимальную и максимальную частоту 0,1 и 0,75 соответственно, а также максимальное количество признаков 50.
  • Примените метод fit_transform() к инициализированному объекту класса TfidfVectorizer, передав список plots.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Редактировать и запускать код