CommencezCommencez gratuitement

Comparer tous vos films avec TF-IDF

Maintenant que vous avez fait le travail nécessaire pour mettre vos données TF-IDF dans un format exploitable, il est temps de les utiliser pour repérer des similarités et générer des recommandations.

Cette fois, comme vous utilisez des scores TF-IDF (qui sont des nombres à virgule flottante plutôt que des valeurs booléennes), vous utiliserez la mesure de similarité cosinus pour trouver les similarités entre les éléments. Dans cet exercice, vous allez générer une matrice de toutes les similarités cosinus entre films et les stocker dans un DataFrame pour en faciliter la consultation. Cela vous permettra de comparer des films et de trouver des recommandations rapidement et facilement.

Le DataFrame tfidf_df que vous avez créé dans l'exercice précédent, contenant une ligne par film, a été chargé pour vous.

Cette activité fait partie du cours

Créer des moteurs de recommandation en Python

Voir le cours

Instructions de l’exercice

  • Trouvez les mesures de similarité cosinus entre tous les films et assignez les résultats à cosine_similarity_array.
  • Créez un DataFrame à partir de cosine_similarity_array en utilisant tfidf_summary_df.index pour ses lignes et ses colonnes.
  • Affichez les cinq premières lignes du DataFrame et examinez les scores de similarité.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import cosine_similarity measure
from sklearn.metrics.pairwise import ____

# Create the array of cosine similarity values
cosine_similarity_array = ____(tfidf_summary_df)

# Wrap the array in a pandas DataFrame
cosine_similarity_df = pd.____(cosine_similarity_array, ____=____.____, ____=____.____)

# Print the top 5 rows of the DataFrame
print(cosine_similarity_df.head())
Modifier et exécuter le code