Dosya bulma
Tweet veri kümesini temizlemen pek içinaçıcı olmadı. Hâlâ duygu taşımayan fazladan dizgiler var. Bunların arasında metin dosyası adlarını ifade eden dizgiler de bulunuyor.
Bunları tespit etmenin bir yolunu da buldun:
- Dizgenin başında yer alıyorlar.
- Her zaman 2 veya 3 adet büyük ya da küçük sesli harf (a e i o u) ile başlıyorlar.
- Her zaman
txtson ekiyle bitiyorlar.
Bunları doğrudan silip silmemen gerektiğinden emin değilsin. Bu yüzden onları bulup ayrı bir veri kümesinde saklamak için bir betik yazıyorsun.
Yardımcı olması için bazı metakarakterleri not aldın: ^ başlangıca sabitleme, . herhangi bir karakter.
İki tweet metni içeren sentiment_analysis değişkeni ve re modülü oturumunda zaten yüklü. IPython Shell'de görmek için print() kullanabilirsin.
Bu egzersiz, kursun bir parçasıdır
Python'da Regular Expressions
Egzersiz talimatları
- Metin dosyası adlarının desenini eşleştiren bir regex yaz, örn.
aemyfile.txt. sentiment_analysisöğelerindeki regex'in tüm eşleşmelerini bul. Sonucu yazdır.- Regex ile eşleşenlerin tümünü boş bir dizge
""ile değiştir. Sonucu yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))