Tokenları alma
Sıradaki adımın, tweet metinlerini token'lara ayırmak. Tokenizasyon, bir stringi sözcüksel birimlere, yani basitçe sözcüklere bölme işlemidir. Ama önce süreçte bulanıklık yaratmamaları için hashtag'leri kaldırman gerekiyor. Hashtag'lerin # sembolüyle başladığını, harf ve sayılar içerdiğini ama asla boşluk barındırmadığını fark ediyorsun. Bunun ardından, token'ları elde etmek için metni boşluk eşleşmelerinde bölmeyi planlıyorsun.
Yardım için niceleyici (quantifier) listesini getiriyorsun: * sıfır veya daha fazla, + bir veya daha fazla, ? sıfır veya bir, {n, m} en az n, en çok m.
Bir tweet'in metnini içeren sentiment_analysis değişkeni ve re modülü oturumuna zaten yüklü. IPython Shell'de görüntülemek için print(sentiment_analysis) kullanabilirsin.
Bu egzersiz, kursun bir parçasıdır
Python'da Regular Expressions
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Write a regex matching the hashtag pattern
regex = r"____"