Durak sözcüklerle havayolu duyarlılığı
tweets adlı bir veri kümesi verildi; bu küme, müşterilerin havayolları hakkındaki yorumlarını ve duyarlılıklarını içeriyor. İki sütundan oluşur: airline_sentiment ve text. Duyarlılık pozitif, negatif veya nötr olabilir; text ise tweet’in metnidir.
Bu egzersizde, durak sözcükleri hesaba katarak bir BOW temsili oluşturacaksın. Durak sözcüklerin bilgi taşımadığını ve onları kaldırmak isteyebileceğini unutma. Bu, daha küçük bir sözcük dağarcığı ve sonuçta daha az özellik elde etmeni sağlar. Ayrıca, varsayılan durak sözcükler listesini bağlamımıza özgü olanlarla zenginleştirebileceğini aklında tut.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Varsayılan İngilizce durak sözcükler listesini içe aktar.
- Verilen liste
['airline', 'airlines', '@']ile varsayılan durak sözcükler listesini güncelleyerekmy_stop_wordsoluştur. - Vektörleştiricide durak sözcükler argümanını belirt.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())