BaşlayınÜcretsiz başlayın

Adım 2: Bir vektörleştirici oluşturma

Bu egzersizde, reviews veri kümesindeki review sütununun TfIDf dönüşümünü oluşturman isteniyor. n-gram'leri, durdurma sözcüklerini, belirteç (token) desenini ve sözlük (vocabulary) boyutu argümanlarını belirtmen bekleniyor.

Bu, bir incelemenin duyarlılığını (sentiment) tahmin etmek için bir sınıflandırıcı eğitmeden önceki son adım.

Özelliklerin maksimum sayısını doğru belirttiğinden emin ol; çok büyük bir sözlük boyutu oturumunun kopmasına neden olabilir.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • Tfidf vektörleştiricisini ve varsayılan İngilizce durdurma sözcükleri listesini içe aktar.
  • Tfidf vektörleştiricisini, şu sırayla şu argümanları belirterek oluştur: durdurma sözcükleri olarak varsayılan İngilizce listesini kullan; n-gram olarak uni- ve bi-gram kullan; maksimum özellik sayısı 200 olmalı; yalnızca belirtilen desenle kelimeleri yakala.
  • Tfidf vektörleştiricisini kullanarak bir DataFrame oluştur.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
Kodu Düzenle ve Çalıştır