Skapa en TF-IDF-DataFrame
Nu när du har genererat dina TF-IDF-särdrag behöver du få dem i ett format som du kan använda för att göra rekommendationer.
Du kommer återigen att använda pandas för detta och omsluta arrayen i en DataFrame.
Eftersom du kommer att använda filmtitlarna för att filtrera data kan du tilldela titlarna till DataFramens index.
DataFrame:n df_plots har laddats in åt dig igen. Den innehåller filmernas namn i kolumnen Title och deras handlingar i kolumnen Plot.
Den här övningen är en del av kursen
Bygga rekommendationsmotorer i Python
Övningsinstruktioner
- Skapa en
TfidfVectorizeroch anpassa och transformera den på samma sätt som i föregående övning. - Omslut den genererade
vectorized_datai en DataFrame. Använd namnen på de särdrag som genererades under anpassnings- och transformationsfasen som kolumnnamn och tilldela din nya DataFrame tilltfidf_df. - Tilldela de ursprungliga filmtitlarna till indexet i den nyligen skapade DataFrame:n
tfidf_df.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())