Python में RegEx
रूल-आधारित इन्फॉर्मेशन एक्सट्रैक्शन कई NLP टास्क में काम आता है। कुछ प्रकार की एंटिटीज़, जैसे तारीखें या फ़ोन नंबर, का फॉर्मेट स्पष्ट होता है जिसे नियमों के सेट से बिना कोई मॉडल ट्रेन किए पहचाना जा सकता है। इस अभ्यास में, आप RegEx के लिए re पैकेज का उपयोग करना अभ्यास करेंगे। लक्ष्य दिए गए text में फ़ोन नंबर ढूँढना है।
re पैकेज आपके लिए पहले से इम्पोर्ट किया गया है। आप \d का उपयोग उस मेटाकैरेक्टर के रूप में कर सकते हैं जो 0 से 9 तक किसी भी अंक से मेल खाता है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
- (111)-111-1111 के रूप वाले फ़ोन नंबर से मेल खाने के लिए एक पैटर्न परिभाषित करें.
re.finditer()मेथड का उपयोग करके सभी मैचिंग पैटर्न ढूँढें.- हर मैच के लिए, दिए गए
textमें उसके आरंभ और अंत कैरेक्टर की पोज़िशन और मैच हुआ भाग प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
text = "Our phone number is (425)-123-4567."
# Define a pattern to match phone numbers
pattern = r"\((____){____}\)-(____){____}-(____){____}"
# Find all the matching patterns in the text
phones = re.____(pattern, text)
# Print start and end characters and matching section of the text
for match in phones:
start_char = match.____
end_char = match.____
print("Start character: ", ____, "| End character: ", ____, "| Matching text: ", text[____:____])