Více textových sloupců
V tomto cvičení budeš pokračovat v práci s tweetovými daty o aerolinkách. Dataset tweets je už naimportovaný.
Někdy může mít dataset více než jeden textový sloupec a pro každý z nich budeš chtít vytvořit číselnou reprezentaci. Kromě sloupce text, který obsahuje samotný text tweetu, tu najdeš druhý textový sloupec negativereason. Ten obsahuje důvod, proč zákazník zanechal negativní recenzi.
Tvým úkolem je sestavit BOW reprezentace pro oba sloupce a určit požadovaná stop slova.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj balíček vektorizátoru a výchozí seznam anglických stop slov.
- Aktualizuj výchozí seznam anglických stop slov a vytvoř množinu
my_stop_words. - V prvním vektorizátoru nastav argument stop slov na aktualizovanou množinu a ve druhém vektorizátoru na výchozí sadu anglických stop slov.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())