Créer le DataFrame TF-IDF
Maintenant que vous avez généré les caractéristiques TF-IDF, vous devez les convertir dans un format que vous pourrez utiliser pour faire des recommandations.
Vous allez de nouveau utiliser pandas et encapsuler le tableau dans un DataFrame.
Comme vous utiliserez les titres de films pour filtrer les données, vous pouvez attribuer les titres à l'index du DataFrame.
Le DataFrame df_plots a de nouveau été chargé pour vous. Il contient les noms des films dans la colonne Title et leurs résumés dans la colonne Plot.
Cette activité fait partie du cours
Créer des moteurs de recommandation en Python
Instructions de l’exercice
- Créez un
TfidfVectorizeret entraînez-le puis transformez les données comme dans l'exercice précédent. - Encapsulez le
vectorized_datagénéré dans un DataFrame. Utilisez les noms des caractéristiques générées pendant l'étape d'ajustement et de transformation comme noms de colonnes et assignez votre nouveau DataFrame àtfidf_df. - Assignez les titres originaux des films à l'index du DataFrame
tfidf_dfnouvellement créé.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object and transform the plot column
vectorizer = ____(max_df=0.7, min_df=2)
vectorized_data = vectorizer.____(df_plots['Plot'])
# Create Dataframe from TF-IDFarray
tfidf_df = pd.____(____.toarray(), columns=vectorizer.____())
# Assign the movie titles to the index and inspect
tfidf_df.____ = ____['Title']
print(tfidf_df.head())