TfIdf sur les données de sentiment des compagnies aériennes sur Twitter
Vous allez maintenant construire des variables à l'aide de la méthode TfIdf. Vous continuerez à travailler avec l'ensemble de données tweets.
Dans cet exercice, vous mettrez en pratique ce que vous avez appris dans les leçons précédentes : retirer les mots vides (stop words), utiliser un gabarit de jeton (token pattern) et préciser les n-grammes.
Le résultat final sera un DataFrame dont les colonnes sont créées avec TfidfVectorizer(). Un tel DataFrame peut être transmis directement à un modèle d'apprentissage supervisé, ce que nous aborderons au prochain chapitre.
Cette activité fait partie du cours
Analyse de sentiment en Python
Instructions de l’exercice
- Importez le module requis pour construire un TfidfVectorizer et
ENGLISH_STOP_WORDS. - Construisez un vectoriseur TfIdf à partir de la colonne
textde l'ensembletweets, en précisant les uni- et bi-grammes comme choix de n-grammes, des jetons qui ne contiennent que des caractères alphanumériques au moyen du gabarit de jeton fourni, ainsi que les mots vides correspondant àENGLISH_STOP_WORDS. - Transformez avec le vectoriseur, en indiquant la même colonne que celle utilisée pour l'ajustement (fit).
- Indiquez les noms de colonnes dans la fonction
DataFrame().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())