Farkı anlamak
Tweet veri kümeni üzerinde çalışmaya ve temizlemeye devam etmen gerekiyor. Bazı HTML etiketleri olduğunu fark ettin. Bunları kaldırmalı ama analiz için faydalı oldukları için içlerindeki içeriği korumalısın.
Bir HTML etiketi içeren şu cümleye bakalım:
I want to see that <strong>amazing show</strong> again!.
HTML etiketini yakalamak için, köşeli ayraçlar < > arasındaki her şeyi eşlemen gerektiğini biliyorsun. Ama en büyük sorun, kapanış etiketinin de aynı yapıda olması. Eğer çok fazla eşlersen, önemli bilgileri silmiş olursun. Bu yüzden açgözlü (greedy) mü yoksa tembel (lazy) bir niceleyici mi kullanacağına karar vermelisin.
Dizge zaten oturumunda string olarak yüklü.
Bu egzersiz, kursun bir parçasıdır
Python'da Regular Expressions
Egzersiz talimatları
remodülünü içe aktar.- HTML etiketlerini boş bir dizeyle değiştirmek için bir
regexifadesi yaz. - Sonucu yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____