BOW ile token dizi uzunluğunu belirt
Videoda, farklı uzunluklarda tokenlar — yani n-gramlar — belirleyerek bağlamı daha iyi yakalayabildiğimizi ve bunun çok önemli olabileceğini gördük.
Bu egzersizde, Amazon ürün yorumlarının bir örneklemiyle çalışacaksın. Görevin, review sütununu kullanarak bir BOW sözlüğü oluşturmak ve token dizilerinin uzunluğunu belirtmek.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Token dizi uzunluğunu uni- ve bigram olacak şekilde belirterek vektörleştiriciyi oluştur.
- Vektörleştiriciyi fit et.
- Fit edilen vektörleştiriciyi dönüştür.
- DataFrame içinde sütun adlarını doğru şekilde belirttiğinden emin ol.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())