TF-IDF des résumés de films
Utilisons les résumés de films sélectionnés au hasard pour effectuer un regroupement de documents. Avant de procéder au regroupement, il faut nettoyer les documents des éléments indésirables (comme les caractères spéciaux et les mots vides) et les convertir en matrice creuse au moyen du TF-IDF des documents.
Utilisez la classe TfidfVectorizer pour calculer le TF-IDF des résumés de films stockés dans la liste plots. La fonction remove_noise() est disponible et peut être utilisée comme tokenizer dans la classe TfidfVectorizer. La méthode .fit_transform() ajuste les données dans l'objet TfidfVectorizer puis génère la matrice creuse TF-IDF.
Remarque : l'exécution de la méthode .fit_transform() prend quelques secondes.
Cette activité fait partie du cours
Analyse de grappes en Python
Instructions de l’exercice
- Importez la classe
TfidfVectorizerà partir desklearn. - Initialisez la classe
TfidfVectorizeravec des fréquences minimale et maximale de 0,1 et 0,75, et 50 caractéristiques au maximum. - Utilisez la méthode
fit_transform()sur l'instance deTfidfVectorizeravec la liste plots.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____