ÎncepețiÎncepe gratuit

Sentimentul față de companii aeriene cu cuvinte de stopare

Ai la dispoziție un set de date numit tweets, care conține recenziile și sentimentele clienților față de companii aeriene. Acesta are două coloane: airline_sentiment și text, unde sentimentul poate fi pozitiv, negativ sau neutru, iar text reprezintă conținutul tweet-ului.

În acest exercițiu, vei crea o reprezentare de tip BOW (Bag of Words), ținând cont de cuvintele de stopare. Ține minte că aceste cuvinte nu sunt informative și, de obicei, este recomandat să le elimini. Astfel vei obține un vocabular mai mic și, în final, mai puține caracteristici. De asemenea, poți îmbogăți lista implicită de cuvinte de stopare cu termeni specifici contextului tău.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă lista implicită de cuvinte de stopare în limba engleză.
  • Actualizează lista implicită de cuvinte de stopare cu lista ['airline', 'airlines', '@'] pentru a crea my_stop_words.
  • Specifică argumentul pentru cuvintele de stopare în vectorizator.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Editează și rulează codul