BaşlayınÜcretsiz başlayın

Durak sözcüklerle havayolu duyarlılığı

tweets adlı bir veri kümesi verildi; bu küme, müşterilerin havayolları hakkındaki yorumlarını ve duyarlılıklarını içeriyor. İki sütundan oluşur: airline_sentiment ve text. Duyarlılık pozitif, negatif veya nötr olabilir; text ise tweet’in metnidir.

Bu egzersizde, durak sözcükleri hesaba katarak bir BOW temsili oluşturacaksın. Durak sözcüklerin bilgi taşımadığını ve onları kaldırmak isteyebileceğini unutma. Bu, daha küçük bir sözcük dağarcığı ve sonuçta daha az özellik elde etmeni sağlar. Ayrıca, varsayılan durak sözcükler listesini bağlamımıza özgü olanlarla zenginleştirebileceğini aklında tut.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • Varsayılan İngilizce durak sözcükler listesini içe aktar.
  • Verilen liste ['airline', 'airlines', '@'] ile varsayılan durak sözcükler listesini güncelleyerek my_stop_words oluştur.
  • Vektörleştiricide durak sözcükler argümanını belirt.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____

# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])

# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)

# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Kodu Düzenle ve Çalıştır