CommencezCommencez gratuitement

Sentiment sur les compagnies aériennes avec mots vides

On vous fournit un jeu de données, nommé tweets, qui contient des avis de clients et leur sentiment au sujet de compagnies aériennes. Il comporte deux colonnes : airline_sentiment et text, où le sentiment peut être positif, négatif ou neutre, et text correspond au texte du gazouillis.

Dans cet exercice, vous allez créer une représentation SAC (sac de mots) en tenant compte des mots vides. Rappelez-vous que les mots vides ne sont pas informatifs et que vous pourriez vouloir les retirer. Cela donnera un vocabulaire plus restreint et, au final, moins de caractéristiques. Gardez en tête que nous pouvons enrichir une liste par défaut de mots vides avec des mots propres à notre contexte.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Importez la liste par défaut des mots vides en anglais.
  • Mettez à jour la liste par défaut des mots vides avec la liste fournie ['airline', 'airlines', '@'] pour créer my_stop_words.
  • Indiquez l'argument des mots vides dans le vectoriseur.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Modifier et exécuter le code