Plusieurs colonnes de texte
Dans cet exercice, vous allez poursuivre le travail avec les données Twitter des compagnies aériennes. Un jeu de données tweets a été importé pour vous.
Dans certains cas, un jeu de données peut contenir plus d'une colonne de texte, et vous pourriez vouloir créer une représentation numérique pour chacune d'elles. Ici, en plus de la colonne text, qui contient le contenu du gazouillis, il y a une deuxième colonne de texte, appelée negativereason. Elle contient la raison pour laquelle le client a laissé un avis négatif.
Votre tâche est de créer des représentations SAC pour les deux colonnes et de préciser les mots vides requis.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez le module de vectorisation et la liste par défaut des mots vides en anglais.
- Mettez à jour la liste par défaut des mots vides en anglais et créez l'ensemble
my_stop_words. - Indiquez, pour le premier vectoriseur, le paramètre des mots vides avec l'ensemble mis à jour, et pour le second vectoriseur, la liste par défaut des mots vides en anglais.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())