Adım 2: Bir vektörleştirici oluşturma
Bu egzersizde, reviews veri kümesindeki review sütununun TfIDf dönüşümünü oluşturman isteniyor. n-gram'leri, durdurma sözcüklerini, belirteç (token) desenini ve sözlük (vocabulary) boyutu argümanlarını belirtmen bekleniyor.
Bu, bir incelemenin duyarlılığını (sentiment) tahmin etmek için bir sınıflandırıcı eğitmeden önceki son adım.
Özelliklerin maksimum sayısını doğru belirttiğinden emin ol; çok büyük bir sözlük boyutu oturumunun kopmasına neden olabilir.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Tfidf vektörleştiricisini ve varsayılan İngilizce durdurma sözcükleri listesini içe aktar.
- Tfidf vektörleştiricisini, şu sırayla şu argümanları belirterek oluştur: durdurma sözcükleri olarak varsayılan İngilizce listesini kullan; n-gram olarak uni- ve bi-gram kullan; maksimum özellik sayısı 200 olmalı; yalnızca belirtilen desenle kelimeleri yakala.
- Tfidf vektörleştiricisini kullanarak bir DataFrame oluştur.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())