CommencezCommencez gratuitement

TF-IDF des résumés de films

Utilisons les résumés de films sélectionnés au hasard pour effectuer un regroupement de documents. Avant de procéder au regroupement, il faut nettoyer les documents des éléments indésirables (comme les caractères spéciaux et les mots vides) et les convertir en matrice creuse au moyen du TF-IDF des documents.

Utilisez la classe TfidfVectorizer pour calculer le TF-IDF des résumés de films stockés dans la liste plots. La fonction remove_noise() est disponible et peut être utilisée comme tokenizer dans la classe TfidfVectorizer. La méthode .fit_transform() ajuste les données dans l'objet TfidfVectorizer puis génère la matrice creuse TF-IDF.

Remarque : l'exécution de la méthode .fit_transform() prend quelques secondes.

Cette activité fait partie du cours

Analyse de grappes en Python

Voir le cours

Instructions de l’exercice

  • Importez la classe TfidfVectorizer à partir de sklearn.
  • Initialisez la classe TfidfVectorizer avec des fréquences minimale et maximale de 0,1 et 0,75, et 50 caractéristiques au maximum.
  • Utilisez la méthode fit_transform() sur l'instance de TfidfVectorizer avec la liste plots.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Modifier et exécuter le code