CommencezCommencez gratuitement

Plusieurs colonnes de texte

Dans cet exercice, vous allez poursuivre le travail avec les données Twitter des compagnies aériennes. Un jeu de données tweets a été importé pour vous.

Dans certains cas, un jeu de données peut contenir plus d'une colonne de texte, et vous pourriez vouloir créer une représentation numérique pour chacune d'elles. Ici, en plus de la colonne text, qui contient le contenu du gazouillis, il y a une deuxième colonne de texte, appelée negativereason. Elle contient la raison pour laquelle le client a laissé un avis négatif.

Votre tâche est de créer des représentations SAC pour les deux colonnes et de préciser les mots vides requis.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Importez le module de vectorisation et la liste par défaut des mots vides en anglais.
  • Mettez à jour la liste par défaut des mots vides en anglais et créez l'ensemble my_stop_words.
  • Indiquez, pour le premier vectoriseur, le paramètre des mots vides avec l'ensemble mis à jour, et pour le second vectoriseur, la liste par défaut des mots vides en anglais.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Modifier et exécuter le code