TF-IDF сюжетов фильмов
Воспользуемся сюжетами случайно выбранных фильмов для кластеризации документов. Перед тем как приступить к кластеризации, тексты необходимо очистить от нежелательного шума (специальных символов и стоп-слов) и преобразовать в разреженную матрицу с помощью TF-IDF.
Применит класс TfidfVectorizer для вычисления TF-IDF сюжетов фильмов, хранящихся в списке plots. Функция remove_noise() доступна для использования в качестве параметра tokenizer в классе TfidfVectorizer. Метод .fit_transform() обучает объект TfidfVectorizer на данных и формирует разреженную матрицу TF-IDF.
Примечание: выполнение метода .fit_transform() может занять несколько секунд.
Это упражнение является частью курса
Кластерный анализ на Python
Инструкции к упражнению
- Импортируйте класс
TfidfVectorizerиз библиотекиsklearn. - Инициализируйте класс
TfidfVectorizer, задав минимальную и максимальную частоту 0,1 и 0,75 соответственно, а также максимальное количество признаков 50. - Примените метод
fit_transform()к инициализированному объекту классаTfidfVectorizer, передав списокplots.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____