Twitter havayolu duygu verisi üzerinde TfIdf
Şimdi TfIdf yöntemiyle öznitelikler oluşturacaksın. tweets veri kümesiyle çalışmaya devam edeceksin.
Bu egzersizde, önceki derslerde öğrendiklerini kullanarak durak (stop) kelimeleri kaldıracak, bir token deseni (pattern) kullanacak ve n-gram’leri belirleyeceksin.
Nihai çıktı, sütunları TfidfVectorizer() kullanılarak oluşturulmuş bir DataFrame olacak. Böyle bir DataFrame doğrudan bir gözetimli öğrenme modeline verilebilir; bunu bir sonraki bölümde ele alacağız.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Bir TfidfVectorizer oluşturmak ve
ENGLISH_STOP_WORDS'u kullanmak için gerekli paketi içe aktar. tweetsveri kümesinintextsütunundan bir TfIdf vektörizer oluştur: n-gram seçeneği olarak uni- ve bi-gram’leri belirt, verilen token deseniyle yalnızca alfasayısal karakterlerden oluşan token’ları kullan ve durak kelimeler içinENGLISH_STOP_WORDS'u ata.- Vektörizeri dönüştürürken, fit ettiğin aynı sütunu belirt.
DataFrame()fonksiyonunda sütun adlarını belirt.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())