Sentiment leteckých společností se stop slovy
K dispozici máš dataset tweets, který obsahuje recenze zákazníků a jejich sentiment týkající se leteckých společností. Skládá se ze dvou sloupců: airline_sentiment a text, kde sentiment může být pozitivní, negativní nebo neutrální a text obsahuje samotný tweet.
V tomto cvičení vytvoříš reprezentaci BOW, ale tentokrát zohledníš stop slova. Stop slova nejsou informačně přínosná a obvykle je chceme odstranit – výsledkem bude menší slovník a nakonec i méně příznaků. Nezapomeň, že výchozí seznam stop slov lze obohatit o výrazy specifické pro daný kontext.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj výchozí seznam anglických stop slov.
- Rozšiř výchozí seznam stop slov o zadaný seznam
['airline', 'airlines', '@']a vytvoř takmy_stop_words. - Zadej argument stop slov do vektorizéru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())