BaşlayınÜcretsiz başlayın

Uuuuzatılmış karakterler

Duygu analizi görevine geri dönüyoruz! Sıradaki işin, tweet'lerde geçen uzatılmış kelimeleri değiştirmek. Uzatılmış kelimeyi, aynı karakterin art arda iki veya daha fazla kez tekrarlandığı kelime olarak tanımlıyoruz. örn. "Harikaaaaa".

Bu kelimeleri değiştirmek çok önemli; çünkü bir sınıflandırıcı onları kaynak kelimelerden farklı terimler olarak ele alır ve frekanslarını düşürür.

Bunları bulmak için yakalama grupları kullanacak ve sayılarla geri başvuracaksın. Örn. \4.

Awesoooome için bir eşleşme bulmak istersen, önce Awes bölümünü yakalaman gerekir. Sonra o'yu eşle ve aynı karaktere geri başvur; ardından me ile devam et.

Üç tweet'in metnini içeren sentiment_analysis listesi ve re modülü oturumunda yüklü. Verileri görmek için IPython Shell'de print() kullanabilirsin.

Bu egzersiz, kursun bir parçasıdır

Python'da Regular Expressions

Kursa Göz Atın

Egzersiz talimatları

  • Açıklandığı gibi uzatılmış bir kelimeyi eşleyecek düzenli ifadeyi tamamla.
  • sentiment_analysis listesindeki öğelerde uzatılmış kelime olup olmadığını bulmak için ara. Sonucu match_elongated değişkenine ata.
  • Yakalanan sıfırıncı grup numarasını elongated_word değişkenine ata.
  • elongated_word değişkeninde yer alan sonucu yazdır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Complete the regex to match an elongated word
regex_elongated = r"____(____)____\w*"

for tweet in sentiment_analysis:
	# Find if there is a match in each tweet 
	match_elongated = re.____(____, ____)
    
	if match_elongated:
		# Assign the captured group zero 
		elongated_word = match_elongated.____(____)
        
		# Complete the format method to print the word
		print("Elongated word found: {____}".format(word=____))
	else:
		print("No elongated word found") 
Kodu Düzenle ve Çalıştır