Her şey tertemiz
Twitter duygu analizi projenine geri dön! Duygu analizini zorlaştıran birkaç tür dize var. Ancak bu dizeler hiçbir işe yarar duygu bilgisi sağlamıyor. Bunların arasında bağlantılar ve kullanıcı bahsetmeleri (mentions) olabilir.
Tweet'leri temizlemek için önce bazı örnekleri çıkarmak istiyorsun. Çoğu zaman bağlantıların http ile başladığını ve hiç boşluk içermediğini biliyorsun; örneğin https://www.datacamp.com. Kullanıcı bahsetmeleri @ ile başlar ve yalnızca harf ve sayılardan oluşur; örneğin @johnsmith3.
İşine yarayacak bazı nicelik belirteçlerini (quantifier) not ediyorsun: * sıfır veya daha fazla, + bir veya daha fazla, ? sıfır veya bir kez.
Üç tweet metnini içeren sentiment_analysis listesi oturumuna zaten yüklendi. Veriyi IPython Shell'de görmek için print() kullanabilirsin.
Bu egzersiz, kursun bir parçasıdır
Python'da Regular Expressions
Egzersiz talimatları
remodülünü içe aktar.sentiment_analysisiçindeki her birtweetiçinde görünenhttpbağlantılarının tüm eşleşmelerini bulmak için bir regex yaz. Sonucu yazdır.sentiment_analysisiçindeki her birtweetiçinde görünen kullanıcı bahsetmelerinin tüm eşleşmelerini bulmak için bir regex yaz. Sonucu yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))