शुरू करेंमुफ़्त में शुरू करें

शब्दों से आगे: टोकनाइज़ेशन (3)

ft_tokenizer() स्पेसेज़ पर टेक्स्ट को विभाजित करके शब्द निकालने की एक सरल तकनीक अपनाता है। अधिक उन्नत उपयोग के लिए, आप टेक्स्ट को बाँटने हेतु रेगुलर एक्सप्रेशन का उपयोग कर सकते हैं। यह ft_regex_tokenizer() फंक्शन के माध्यम से किया जाता है, जिसका उपयोग ft_tokenizer() जैसा ही है, लेकिन स्प्लिटर के लिए एक अतिरिक्त pattern आर्ग्युमेंट होता है।

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

ft_regex_tokenizer() का रिटर्न वैल्यू, ft_tokenizer() की तरह, कैरेक्टर वेक्टरों की लिस्ट की लिस्ट होता है।

डेटासेट में artist_mbid नाम का एक फील्ड है जिसमें MusicBrainz (एक म्यूज़िक मेटाडेटा एन्साइक्लोपीडिया वेबसाइट) पर आर्टिस्ट का ID होता है। ये IDs हेक्साडेसिमल नंबरों के रूप में होती हैं जिन्हें हाइफ़न से बाँटा जाता है, उदाहरण के लिए, 65b785d9-499f-48e6-9063-3a1fd1bd488d.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • track_metadata_tbl से artist_mbid फील्ड चुनें.
  • MusicBrainz IDs को हेक्साडेसिमल नंबरों के हिस्सों में बाँटें.
    • ft_regex_tokenizer() कॉल करें.
    • आउटपुट कॉलम का नाम artist_mbid_chunks होना चाहिए.
    • pattern आर्ग्युमेंट के लिए हाइफ़न - का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
कोड संपादित करें और चलाएँ