Kom igångKom igång gratis

Skapa en TF-IDF-DataFrame

Nu när du har genererat dina TF-IDF-särdrag behöver du få dem i ett format som du kan använda för att göra rekommendationer. Du kommer återigen att använda pandas för detta och omsluta arrayen i en DataFrame. Eftersom du kommer att använda filmtitlarna för att filtrera data kan du tilldela titlarna till DataFramens index.

DataFrame:n df_plots har laddats in åt dig igen. Den innehåller filmernas namn i kolumnen Title och deras handlingar i kolumnen Plot.

Den här övningen är en del av kursen

Bygga rekommendationsmotorer i Python

Visa kurs

Övningsinstruktioner

  • Skapa en TfidfVectorizer och anpassa och transformera den på samma sätt som i föregående övning.
  • Omslut den genererade vectorized_data i en DataFrame. Använd namnen på de särdrag som genererades under anpassnings- och transformationsfasen som kolumnnamn och tilldela din nya DataFrame till tfidf_df.
  • Tilldela de ursprungliga filmtitlarna till indexet i den nyligen skapade DataFrame:n tfidf_df.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot']) 

# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())

# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())
Redigera och kör kod