शुरू करेंमुफ़्त में शुरू करें

अंतर समझना

आपको अपने ट्वीट्स डेटासेट पर काम जारी रखना है और उसे क्लीन करना है। आपको पता चलता है कि इसमें कुछ HTML टैग मौजूद हैं। आपको इन्हें हटाना है, लेकिन अंदर की सामग्री को वैसे ही रखना है क्योंकि वह विश्लेषण के लिए उपयोगी है.

आइए एक वाक्य देखते हैं जिसमें HTML टैग है:

I want to see that <strong>amazing show</strong> again!.

आप जानते हैं कि HTML टैग पाने के लिए आपको एंगल ब्रैकेट < > के बीच आने वाली किसी भी चीज़ को मैच करना होगा। लेकिन सबसे बड़ी दिक्कत यह है कि क्लोज़िंग टैग की संरचना भी वही होती है। अगर आपने ज़्यादा मैच कर लिया, तो आप अहम जानकारी हटा देंगे। इसलिए आपको तय करना है कि ग्रीडी या लेज़ी क्वांटिफायर में से किसका उपयोग करें।

यह स्ट्रिंग आपके सेशन में पहले से string नाम से लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Regular Expressions

पाठ्यक्रम देखें

अभ्यास निर्देश

  • re मॉड्यूल इम्पोर्ट करें.
  • एक regex एक्सप्रेशन लिखें जो HTML tags को खाली स्ट्रिंग से रिप्लेस करे.
  • परिणाम प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
कोड संपादित करें और चलाएँ