शुरू करेंमुफ़्त में शुरू करें

टेक्स्ट डेटा से हाथ आज़माना

इस अभ्यास में, आप The Big Bang Theory टीवी शो में शेल्डन कूपर के उद्धरणों (quotes) का विश्लेषण करके टेक्स्ट डेटा के साथ काम करेंगे. इससे आपको वाक्यों का विश्लेषण करने और यह समझने का अवसर मिलेगा कि वास्तविक दुनिया के टेक्स्ट डेटा से निपटने का अनुभव कैसा होता है.

आप डिक्शनरी कॉम्प्रिहेंशंस का उपयोग करके ऐसी डिक्शनरियाँ बनाएँगे जो शब्दों को इंडेक्स से और इंडेक्स को शब्दों से मैप करती हैं. उदाहरण के लिए pandas.DataFrame की बजाय डिक्शनरी का उपयोग इसलिए किया गया है क्योंकि वे अधिक सहज हैं और अनावश्यक जटिलता नहीं जोड़तीं.

डेटा sheldon_quotes में उपलब्ध है, और शुरुआती दो वाक्य आपके लिए पहले से प्रिंट किए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • वाक्यों को join करके एक वैरिएबल में लें, फिर सभी शब्द निकालकर इस लिस्ट को all_words में स्टोर करें.
  • डुप्लिकेट शब्दों को हटाने के लिए शब्दों की लिस्ट पर list(set()) लगाएँ और उन्हें unique_words में स्टोर करें.
  • डिक्शनरी कॉम्प्रिहेंशंस का उपयोग करके एक ऐसी डिक्शनरी बनाएँ जिसमें keys इंडेक्स हों और values शब्द.
  • डिक्शनरी कॉम्प्रिहेंशंस का उपयोग करके एक ऐसी डिक्शनरी बनाएँ जिसमें keys शब्द हों और values इंडेक्स.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
कोड संपादित करें और चलाएँ