शुरू करेंमुफ़्त में शुरू करें

संदर्भ सहित नाम निकालें

आइए फिर से स्विस राजनेताओं के बारे में अपना डेटासेट लेते हैं. इसमें दो वैरिएबल हैं: articles, जो स्विस राजनीति पर न्यूज़ आर्टिकल्स का संग्रह है, और politicians, जो स्विस राजनेताओं के कई नामों वाला एक वेक्टर है.

आप पहले ही प्रति नाम आवृत्तियों की गिनती कर चुके हैं, लेकिन क्या यह और रोचक नहीं होगा अगर आप सिर्फ नामों की गिनती ही नहीं, बल्कि यह भी देखें कि इन नामों का किस संदर्भ में उपयोग हुआ है? उदाहरण के लिए, आप देख सकते हैं कि महिला और पुरुष राजनेताओं के संदर्भ अलग हैं या नहीं. ऐसा करने के लिए, आपको हमारे राजनेताओं के नामों के आसपास का टेक्स्ट निकालना होगा.

क्योंकि टेक्स्ट में word characters \\w के साथ-साथ विराम-चिह्न [:punct:] जैसे पूर्ण विराम . या कॉमा , भी हैं, इसलिए आपको ऐसा पैटर्न बनाना होगा जो इन दोनों कैरेक्टर टाइप्स से मैच करे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Intermediate Regular Expressions

पाठ्यक्रम देखें

अभ्यास निर्देश

  • वेक्टर politicians का उपयोग करें और उसे collapse करके अध्याय 2 की तरह एक "or pattern" बनाएँ.
  • square brackets [] में एक कस्टम पैटर्न बनाएँ जो word characters और विराम-चिह्न दोनों से मैच करे.
  • glue का उपयोग करते हुए, नए बने context को polit_pattern के आगे और पीछे दोनों जगह जोड़ें. \\s? दर्शाता है कि राजनेताओं के नामों के बाद एक space हो भी सकता है और नहीं भी.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create our polit_pattern again by collapsing "politicians"
polit_pattern <- glue_collapse(___, sep = "|")

# Match one or more word characters or punctuations
context <- "([___[___]]+\\s){0,10}"

# Add this pattern in front and after the polit_pattern
polit_pattern_with_context <- glue(
  "{___}({polit_pattern})\\s?{___}"
)

str_extract_all(
  articles$text,
  pattern = polit_pattern_with_context
)
कोड संपादित करें और चलाएँ