BaşlayınÜcretsiz başlayın

Birden fazla metin sütunu

Bu egzersizde, havayolu Twitter verileriyle çalışmaya devam edeceksin. Senin için tweets adlı bir veri kümesi içe aktarıldı.

Bazı durumlarda bir veri kümesinde birden fazla metin sütunu olabilir ve her metin sütunu için sayısal bir gösterim oluşturmak isteyebilirsin. Burada, tweet’in gövdesini içeren text sütununa ek olarak negativereason adlı ikinci bir metin sütunu var. Bu sütun, müşterinin neden olumsuz bir değerlendirme bıraktığını içerir.

Görevin, her iki sütun için de BOW temsilleri oluşturmak ve gerekli durak sözcükleri (stop words) belirtmektir.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • Vektörleştirici paketini ve varsayılan İngilizce durak sözcükler listesini içe aktar.
  • Varsayılan İngilizce durak sözcükler listesini güncelle ve my_stop_words kümesini oluştur.
  • İlk vektörleştiricide stop words argümanını güncellenmiş kümeye, ikinci vektörleştiricide ise varsayılan İngilizce durak sözcükler kümesine ayarla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
Kodu Düzenle ve Çalıştır