Flygbolagssentiment med stoppord
Du har tillgång till en datamängd som heter tweets. Den innehåller kunders recensioner och sentimentdata om flygbolag, och består av två kolumner: airline_sentiment och text. Sentimentet kan vara positivt, negativt eller neutralt, och text innehåller själva tweettexten.
I den här övningen skapar du en BOW-representation med hänsyn till stoppord. Kom ihåg att stoppord inte är informativa och ofta bör tas bort. Det ger ett mindre vokabulär och i förlängningen färre särdrag. Tänk också på att du kan utöka standardlistan med stoppord som är specifika för just ditt sammanhang.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera standardlistan med engelska stoppord.
- Uppdatera standardlistan med stoppord med den givna listan
['airline', 'airlines', '@']för att skapamy_stop_words. - Ange stoppords-argumentet i vektoriseraren.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())