Kom igångKom igång gratis

TF-IDF av filmhandlingar

Vi ska använda handlingar från slumpmässigt utvalda filmer för dokumentklustring. Innan klustring kan genomföras behöver dokumenten rensas från oönskat brus (till exempel specialtecken och stoppord) och omvandlas till en gles matris via TF-IDF.

Använd klassen TfidfVectorizer för att beräkna TF-IDF för filmhandlingarna som finns lagrade i listan plots. Funktionen remove_noise() finns tillgänglig att använda som tokenizer i klassen TfidfVectorizer. Metoden .fit_transform() anpassar data till TfidfVectorizer-objektet och genererar sedan den glesa TF-IDF-matrisen.

Obs! Det tar några sekunder att köra metoden .fit_transform().

Den här övningen är en del av kursen

Klusteranalys i Python

Visa kurs

Övningsinstruktioner

  • Importera klassen TfidfVectorizer från sklearn.
  • Initiera klassen TfidfVectorizer med en minsta och högsta frekvens på 0,1 respektive 0,75, samt maximalt 50 särdrag.
  • Använd metoden fit_transform() på den initierade klassen TfidfVectorizer med listan plots.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Redigera och kör kod