शब्दों से आगे: टोकनाइज़ेशन (3)
ft_tokenizer() स्पेसेज़ पर टेक्स्ट को विभाजित करके शब्द निकालने की एक सरल तकनीक अपनाता है। अधिक उन्नत उपयोग के लिए, आप टेक्स्ट को बाँटने हेतु रेगुलर एक्सप्रेशन का उपयोग कर सकते हैं। यह ft_regex_tokenizer() फंक्शन के माध्यम से किया जाता है, जिसका उपयोग ft_tokenizer() जैसा ही है, लेकिन स्प्लिटर के लिए एक अतिरिक्त pattern आर्ग्युमेंट होता है।
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
ft_regex_tokenizer() का रिटर्न वैल्यू, ft_tokenizer() की तरह, कैरेक्टर वेक्टरों की लिस्ट की लिस्ट होता है।
डेटासेट में artist_mbid नाम का एक फील्ड है जिसमें MusicBrainz (एक म्यूज़िक मेटाडेटा एन्साइक्लोपीडिया वेबसाइट) पर आर्टिस्ट का ID होता है। ये IDs हेक्साडेसिमल नंबरों के रूप में होती हैं जिन्हें हाइफ़न से बाँटा जाता है, उदाहरण के लिए, 65b785d9-499f-48e6-9063-3a1fd1bd488d.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
track_metadata_tblसेartist_mbidफील्ड चुनें.- MusicBrainz IDs को हेक्साडेसिमल नंबरों के हिस्सों में बाँटें.
ft_regex_tokenizer()कॉल करें.- आउटपुट कॉलम का नाम
artist_mbid_chunksहोना चाहिए. patternआर्ग्युमेंट के लिए हाइफ़न-का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___