Représentation TF-IDF des commentaires sur les produits
Vous collaborez avec l'équipe du soutien à la clientèle d'une entreprise de maisons intelligentes. Elle a recueilli des commentaires d'utilisateurs sur divers appareils intelligents et souhaite repérer les mots qui se démarquent dans chaque avis. Vous proposez d'utiliser la technique TF-IDF pour mettre en évidence les termes les plus pertinents dans l'ensemble des commentaires. Aidons-les à démarrer !
Une fonction preprocess() qui reçoit un texte et renvoie une version traitée est déjà chargée. Elle applique la mise en minuscules, la segmentation en jetons (tokenisation) et la suppression de la ponctuation. Pandas a été importée sous pd, et la classe TfidfVectorizer est prête à être utilisée.
Cette activité fait partie du cours
Natural Language Processing (NLP) en Python
Instructions de l’exercice
- Initialisez un
vectorizerTF-IDF. - Transformez les avis nettoyés en
tfidf_matrix. - Créez un DataFrame
dfà partir detfidf_matrix, en utilisant les mots du vocabulaire comme colonnes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())