TF-IDF av filmhandlingar
Vi ska använda handlingar från slumpmässigt utvalda filmer för dokumentklustring. Innan klustring kan genomföras behöver dokumenten rensas från oönskat brus (till exempel specialtecken och stoppord) och omvandlas till en gles matris via TF-IDF.
Använd klassen TfidfVectorizer för att beräkna TF-IDF för filmhandlingarna som finns lagrade i listan plots. Funktionen remove_noise() finns tillgänglig att använda som tokenizer i klassen TfidfVectorizer. Metoden .fit_transform() anpassar data till TfidfVectorizer-objektet och genererar sedan den glesa TF-IDF-matrisen.
Obs! Det tar några sekunder att köra metoden .fit_transform().
Den här övningen är en del av kursen
Klusteranalys i Python
Övningsinstruktioner
- Importera klassen
TfidfVectorizerfrånsklearn. - Initiera klassen
TfidfVectorizermed en minsta och högsta frekvens på 0,1 respektive 0,75, samt maximalt 50 särdrag. - Använd metoden
fit_transform()på den initierade klassenTfidfVectorizermed listan plots.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____