Birden fazla metin sütunu
Bu egzersizde, havayolu Twitter verileriyle çalışmaya devam edeceksin. Senin için tweets adlı bir veri kümesi içe aktarıldı.
Bazı durumlarda bir veri kümesinde birden fazla metin sütunu olabilir ve her metin sütunu için sayısal bir gösterim oluşturmak isteyebilirsin. Burada, tweet’in gövdesini içeren text sütununa ek olarak negativereason adlı ikinci bir metin sütunu var. Bu sütun, müşterinin neden olumsuz bir değerlendirme bıraktığını içerir.
Görevin, her iki sütun için de BOW temsilleri oluşturmak ve gerekli durak sözcükleri (stop words) belirtmektir.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Vektörleştirici paketini ve varsayılan İngilizce durak sözcükler listesini içe aktar.
- Varsayılan İngilizce durak sözcükler listesini güncelle ve
my_stop_wordskümesini oluştur. - İlk vektörleştiricide stop words argümanını güncellenmiş kümeye, ikinci vektörleştiricide ise varsayılan İngilizce durak sözcükler kümesine ayarla.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())