TF-IDF opisów filmów
Wykorzystajmy opisy losowo wybranych filmów do grupowania dokumentów. Przed przystąpieniem do klasteryzacji należy oczyścić dokumenty z niepożądanych elementów (takich jak znaki specjalne i stop words) oraz przekształcić je w macierz rzadką za pomocą TF-IDF.
Użyj klasy TfidfVectorizer, aby wykonać TF-IDF na opisach filmów zapisanych na liście plots. Funkcja remove_noise() jest dostępna jako tokenizer w klasie TfidfVectorizer. Metoda .fit_transform() dopasowuje dane do obiektu TfidfVectorizer, a następnie generuje rzadką macierz TF-IDF.
Uwaga: uruchomienie metody .fit_transform() zajmuje kilka sekund.
To ćwiczenie jest częścią kursu
Analiza skupień w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj klasę
TfidfVectorizerz bibliotekisklearn. - Zainicjalizuj klasę
TfidfVectorizerz minimalną i maksymalną częstotliwością odpowiednio 0.1 i 0.75 oraz maksymalnie 50 cechami. - Użyj metody
fit_transform()na zainicjalizowanym obiekcie klasyTfidfVectorizer, przekazując listęplots.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____