Zacznij terazZacznij za darmo

Sentyment linii lotniczych ze stop słowami

Masz do dyspozycji zbiór danych o nazwie tweets, który zawiera opinie klientów oraz wyrażony przez nich sentyment wobec linii lotniczych. Składa się z dwóch kolumn: airline_sentiment i text, gdzie sentyment może być pozytywny, negatywny lub neutralny, a text to treść tweeta.

W tym ćwiczeniu stworzysz reprezentację BOW z uwzględnieniem stop słów. Pamiętaj, że stop słowa nie niosą istotnych informacji i warto je usunąć – pozwoli to zmniejszyć słownik, a w efekcie ograniczyć liczbę cech. Miej na uwadze, że domyślną listę stop słów można wzbogacić o wyrazy charakterystyczne dla danego kontekstu.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj domyślną listę angielskich stop słów.
  • Zaktualizuj domyślną listę stop słów o podaną listę ['airline', 'airlines', '@'], tworząc my_stop_words.
  • Określ argument stop words w wektoryzatorze.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Edytuj i uruchom kod