ПочатиПочніть безкоштовно

TF-IDF сюжетів фільмів

Скористаймося сюжетами випадково вибраних фільмів, щоб виконати кластеризацію документів. Перш ніж кластеризувати документи, їх потрібно очистити від шуму (наприклад, спеціальних символів і стопслів) і перетворити на розріджену матрицю за допомогою TF-IDF.

Використайте клас TfidfVectorizer, щоб обчислити TF-IDF для сюжетів фільмів, збережених у списку plots. Функція remove_noise() доступна для використання як tokenizer у класі TfidfVectorizer. Метод .fit_transform() навчає TfidfVectorizer на даних і генерує розріджену матрицю TF-IDF.

Примітка: виконання методу .fit_transform() триває кілька секунд.

Ця вправа є частиною курсу

Кластерний аналіз у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас TfidfVectorizer із sklearn.
  • Ініціалізуйте клас TfidfVectorizer з мінімальною та максимальною частотами 0.1 і 0.75 та з максимальною кількістю ознак 50.
  • Використайте метод fit_transform() для ініціалізованого класу TfidfVectorizer зі списком plots.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Редагувати та запускати код