BaşlayınÜcretsiz başlayın

Dosya bulma

Tweet veri kümesini temizlemen pek içinaçıcı olmadı. Hâlâ duygu taşımayan fazladan dizgiler var. Bunların arasında metin dosyası adlarını ifade eden dizgiler de bulunuyor.

Bunları tespit etmenin bir yolunu da buldun:

  • Dizgenin başında yer alıyorlar.
  • Her zaman 2 veya 3 adet büyük ya da küçük sesli harf (a e i o u) ile başlıyorlar.
  • Her zaman txt son ekiyle bitiyorlar.

Bunları doğrudan silip silmemen gerektiğinden emin değilsin. Bu yüzden onları bulup ayrı bir veri kümesinde saklamak için bir betik yazıyorsun.

Yardımcı olması için bazı metakarakterleri not aldın: ^ başlangıca sabitleme, . herhangi bir karakter.

İki tweet metni içeren sentiment_analysis değişkeni ve re modülü oturumunda zaten yüklü. IPython Shell'de görmek için print() kullanabilirsin.

Bu egzersiz, kursun bir parçasıdır

Python'da Regular Expressions

Kursa Göz Atın

Egzersiz talimatları

  • Metin dosyası adlarının desenini eşleştiren bir regex yaz, örn. aemyfile.txt.
  • sentiment_analysis öğelerindeki regex'in tüm eşleşmelerini bul. Sonucu yazdır.
  • Regex ile eşleşenlerin tümünü boş bir dizge "" ile değiştir. Sonucu yazdır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Kodu Düzenle ve Çalıştır