CommencezCommencez gratuitement

TfIdf sur les données de sentiment des compagnies aériennes sur Twitter

Vous allez maintenant construire des variables à l'aide de la méthode TfIdf. Vous continuerez à travailler avec l'ensemble de données tweets.

Dans cet exercice, vous mettrez en pratique ce que vous avez appris dans les leçons précédentes : retirer les mots vides (stop words), utiliser un gabarit de jeton (token pattern) et préciser les n-grammes.

Le résultat final sera un DataFrame dont les colonnes sont créées avec TfidfVectorizer(). Un tel DataFrame peut être transmis directement à un modèle d'apprentissage supervisé, ce que nous aborderons au prochain chapitre.

Cette activité fait partie du cours

Analyse de sentiment en Python

Voir le cours

Instructions de l’exercice

  • Importez le module requis pour construire un TfidfVectorizer et ENGLISH_STOP_WORDS.
  • Construisez un vectoriseur TfIdf à partir de la colonne text de l'ensemble tweets, en précisant les uni- et bi-grammes comme choix de n-grammes, des jetons qui ne contiennent que des caractères alphanumériques au moyen du gabarit de jeton fourni, ainsi que les mots vides correspondant à ENGLISH_STOP_WORDS.
  • Transformez avec le vectoriseur, en indiquant la même colonne que celle utilisée pour l'ajustement (fit).
  • Indiquez les noms de colonnes dans la fonction DataFrame().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the required vectorizer package and stop words list
____

# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)

# Transform the vectorizer
X_txt = vect.____(____.____)

# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())
Modifier et exécuter le code