Kom igångKom igång gratis

Flygbolagssentiment med stoppord

Du har tillgång till en datamängd som heter tweets. Den innehåller kunders recensioner och sentimentdata om flygbolag, och består av två kolumner: airline_sentiment och text. Sentimentet kan vara positivt, negativt eller neutralt, och text innehåller själva tweettexten.

I den här övningen skapar du en BOW-representation med hänsyn till stoppord. Kom ihåg att stoppord inte är informativa och ofta bör tas bort. Det ger ett mindre vokabulär och i förlängningen färre särdrag. Tänk också på att du kan utöka standardlistan med stoppord som är specifika för just ditt sammanhang.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera standardlistan med engelska stoppord.
  • Uppdatera standardlistan med stoppord med den givna listan ['airline', 'airlines', '@'] för att skapa my_stop_words.
  • Ange stoppords-argumentet i vektoriseraren.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Redigera och kör kod