n-gram'lar ve sözlük boyutuyla BOW
Bu egzersizde, Amazon ürün yorumlarından oluşan reviews veri kümesini kullanarak bir kez daha bag-of-words oluşturmayı pratik yapacaksın. Ana görevin, sözlüğün boyutunu sınırlamak ve token dizisinin uzunluğunu belirtmek olacak.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Vektörleyiciyi
sklearniçinden içe aktar. - Vektörleyiciyi oluştur ve şu parametreleri belirttiğinden emin ol: sözlük boyutu 1000 ile sınırlı olmalı, yalnızca bigram'ları dahil et ve 500'den fazla belgede görünen terimleri yok say.
- Vektörleyiciyi
reviewsütununa fit et. - BOW gösteriminden bir DataFrame oluştur.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())