BaşlayınÜcretsiz başlayın

Tokenları alma

Sıradaki adımın, tweet metinlerini token'lara ayırmak. Tokenizasyon, bir stringi sözcüksel birimlere, yani basitçe sözcüklere bölme işlemidir. Ama önce süreçte bulanıklık yaratmamaları için hashtag'leri kaldırman gerekiyor. Hashtag'lerin # sembolüyle başladığını, harf ve sayılar içerdiğini ama asla boşluk barındırmadığını fark ediyorsun. Bunun ardından, token'ları elde etmek için metni boşluk eşleşmelerinde bölmeyi planlıyorsun.

Yardım için niceleyici (quantifier) listesini getiriyorsun: * sıfır veya daha fazla, + bir veya daha fazla, ? sıfır veya bir, {n, m} en az n, en çok m.

Bir tweet'in metnini içeren sentiment_analysis değişkeni ve re modülü oturumuna zaten yüklü. IPython Shell'de görüntülemek için print(sentiment_analysis) kullanabilirsin.

Bu egzersiz, kursun bir parçasıdır

Python'da Regular Expressions

Kursa Göz Atın

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Write a regex matching the hashtag pattern
regex = r"____"
Kodu Düzenle ve Çalıştır