Kom igångKom igång gratis

Flera textkolumner

I den här övningen fortsätter du att arbeta med Twitter-data från flygbolaget. En datamängd, tweets, har redan importerats åt dig.

I vissa situationer kan en datamängd innehålla mer än en textkolumn, och du kanske vill skapa en numerisk representation för var och en av dem. Här finns det, förutom kolumnen text som innehåller själva tweeten, även en andra textkolumn som heter negativereason. Den innehåller anledningen till att kunden lämnade en negativ recension.

Din uppgift är att bygga BOW-representationer för båda kolumnerna och ange de stoppord som krävs.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Importera vektoriseringsbiblioteket och standardlistan med engelska stoppord.
  • Uppdatera standardlistan med engelska stoppord och skapa mängden my_stop_words.
  • Ange stoppord-argumentet i den första vektoriseraren till den uppdaterade mängden, och i den andra vektoriseraren – standardmängden med engelska stoppord.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Redigera och kör kod