TF-IDF сюжетів фільмів
Скористаймося сюжетами випадково вибраних фільмів, щоб виконати кластеризацію документів. Перш ніж кластеризувати документи, їх потрібно очистити від шуму (наприклад, спеціальних символів і стопслів) і перетворити на розріджену матрицю за допомогою TF-IDF.
Використайте клас TfidfVectorizer, щоб обчислити TF-IDF для сюжетів фільмів, збережених у списку plots. Функція remove_noise() доступна для використання як tokenizer у класі TfidfVectorizer. Метод .fit_transform() навчає TfidfVectorizer на даних і генерує розріджену матрицю TF-IDF.
Примітка: виконання методу .fit_transform() триває кілька секунд.
Ця вправа є частиною курсу
Кластерний аналіз у Python
Інструкції до вправи
- Імпортуйте клас
TfidfVectorizerізsklearn. - Ініціалізуйте клас
TfidfVectorizerз мінімальною та максимальною частотами 0.1 і 0.75 та з максимальною кількістю ознак 50. - Використайте метод
fit_transform()для ініціалізованого класуTfidfVectorizerзі списком plots.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____