Sentyment linii lotniczych ze stop słowami
Masz do dyspozycji zbiór danych o nazwie tweets, który zawiera opinie klientów oraz wyrażony przez nich sentyment wobec linii lotniczych. Składa się z dwóch kolumn: airline_sentiment i text, gdzie sentyment może być pozytywny, negatywny lub neutralny, a text to treść tweeta.
W tym ćwiczeniu stworzysz reprezentację BOW z uwzględnieniem stop słów. Pamiętaj, że stop słowa nie niosą istotnych informacji i warto je usunąć – pozwoli to zmniejszyć słownik, a w efekcie ograniczyć liczbę cech. Miej na uwadze, że domyślną listę stop słów można wzbogacić o wyrazy charakterystyczne dla danego kontekstu.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj domyślną listę angielskich stop słów.
- Zaktualizuj domyślną listę stop słów o podaną listę
['airline', 'airlines', '@'], tworzącmy_stop_words. - Określ argument stop words w wektoryzatorze.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())