Twitter verisiyle string işleçleri
text sütununun her bir tweet'in içeriğini sakladığı tweets verisiyle çalışmaya devam ediyorsun.
Görevin, text sütununu bir token listesine dönüştürmek. Ardından, string işleçlerini kullanarak oluşturduğun token listesinden alfabetik olmayan tüm karakterleri kaldır.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
- Sözcük parçalama (word tokenizing) fonksiyonunu içe aktar.
- Her tweet'ten sözcük token'ları oluştur.
- Oluşturduğun listeden alfabetik olmayan tüm karakterleri filtrele; yani yalnızca harfleri tut.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])