Začněte nyníZačněte zdarma

Sentiment leteckých společností se stop slovy

K dispozici máš dataset tweets, který obsahuje recenze zákazníků a jejich sentiment týkající se leteckých společností. Skládá se ze dvou sloupců: airline_sentiment a text, kde sentiment může být pozitivní, negativní nebo neutrální a text obsahuje samotný tweet.

V tomto cvičení vytvoříš reprezentaci BOW, ale tentokrát zohledníš stop slova. Stop slova nejsou informačně přínosná a obvykle je chceme odstranit – výsledkem bude menší slovník a nakonec i méně příznaků. Nezapomeň, že výchozí seznam stop slov lze obohatit o výrazy specifické pro daný kontext.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj výchozí seznam anglických stop slov.
  • Rozšiř výchozí seznam stop slov o zadaný seznam ['airline', 'airlines', '@'] a vytvoř tak my_stop_words.
  • Zadej argument stop slov do vektorizéru.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Upravit a spustit kód