İlk BOW’un
Bag-of-words, metni sayısal forma dönüştürmek için kullanılan bir yaklaşımdır.
Bu egzersizde, bir sonraki egzersizde daha büyük bir veri kümesine geçmeden önce annak listesine bir BOW uygulayacaksın.
Görevin, bu listeyle çalışmak ve CountVectorizer() kullanarak bir BOW uygulamak. Bu dönüşüm, bir metnin duygu durumunu anlayabilmenin ilk adımıdır. Güçlü duygu taşıyabilecek kelimelere dikkat et.
CountVectorizer() çıktısının, yalnızca sıfır olmayan girişleri saklayan seyrek bir matris olduğunu unutma. Bu matrisin gerçek içeriğine bakmak için .toarray() yöntemiyle yoğun bir diziye dönüştürürüz.
Bu durumda metin kısa olduğu için max_features argümanını belirtmene gerek yok.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
sklearn.feature_extraction.textiçinden count vectorizer fonksiyonunu içe aktar.- Küçük veri kümesi üzerinde vektörleştiriciyi kur ve uygula (fit et).
transform()metodunu çağırarakanna_bowadlı BOW gösterimini oluştur.- BOW sonucunu yoğun (dense) bir dizi olarak yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())