Kom igångKom igång gratis

Instansiera TF-IDF-modellen

TF-IDF genererar som standard en kolumn för varje ord i alla dina dokument (i det här fallet filmsammanfattningar). Detta skapar en stor och svåröverskådlig datamängd, eftersom den innehåller både mycket vanliga ord som förekommer i varje dokument och ord som är så sällsynta att de inte bidrar till att hitta likheter mellan objekt.

I den här övningen arbetar du med DataFrame:n df_plots. Den innehåller filmtitlar i kolumnen Title och handlingar i kolumnen Plot.

Med hjälp av denna DataFrame genererar du TF-IDF-poäng med standardinställningar och undersöker om det finns kolumner utan värde.

Du kör sedan om TF-IDF-beräkningarna, den här gången med argumenten min_df och max_df för att begränsa antalet kolumner – och förhoppningsvis se en förbättring.

Den här övningen är en del av kursen

Bygga rekommendationsmotorer i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
Redigera och kör kod