BaşlayınÜcretsiz başlayın

n-gram'lar ve sözlük boyutuyla BOW

Bu egzersizde, Amazon ürün yorumlarından oluşan reviews veri kümesini kullanarak bir kez daha bag-of-words oluşturmayı pratik yapacaksın. Ana görevin, sözlüğün boyutunu sınırlamak ve token dizisinin uzunluğunu belirtmek olacak.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • Vektörleyiciyi sklearn içinden içe aktar.
  • Vektörleyiciyi oluştur ve şu parametreleri belirttiğinden emin ol: sözlük boyutu 1000 ile sınırlı olmalı, yalnızca bigram'ları dahil et ve 500'den fazla belgede görünen terimleri yok say.
  • Vektörleyiciyi review sütununa fit et.
  • BOW gösteriminden bir DataFrame oluştur.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
Kodu Düzenle ve Çalıştır