CommencezCommencez gratuitement

Représentation TF-IDF des commentaires sur les produits

Vous collaborez avec l'équipe du soutien à la clientèle d'une entreprise de maisons intelligentes. Elle a recueilli des commentaires d'utilisateurs sur divers appareils intelligents et souhaite repérer les mots qui se démarquent dans chaque avis. Vous proposez d'utiliser la technique TF-IDF pour mettre en évidence les termes les plus pertinents dans l'ensemble des commentaires. Aidons-les à démarrer !

Une fonction preprocess() qui reçoit un texte et renvoie une version traitée est déjà chargée. Elle applique la mise en minuscules, la segmentation en jetons (tokenisation) et la suppression de la ponctuation. Pandas a été importée sous pd, et la classe TfidfVectorizer est prête à être utilisée.

Cette activité fait partie du cours

Natural Language Processing (NLP) en Python

Voir le cours

Instructions de l’exercice

  • Initialisez un vectorizer TF-IDF.
  • Transformez les avis nettoyés en tfidf_matrix.
  • Créez un DataFrame df à partir de tfidf_matrix, en utilisant les mots du vocabulaire comme colonnes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Modifier et exécuter le code