वाक्यों और अगले कैरेक्टर्स के वेक्टर बनाएँ
यह अभ्यास डेटा प्रिपरेशन के महत्व पर जोर देता है। आप इनपुट के रूप में The Big Bang Theory TV शो के किरदार शेल्डन के वाक्यों वाला टेक्स्ट इस्तेमाल करेंगे, और टेक्स्ट जनरेशन मॉडल बनाने से पहले ज़रूरी वाक्य-इंडेक्स और अगले कैरेक्टर्स के वेक्टर तैयार करेंगे.
टेक्स्ट sheldon वैरिएबल में उपलब्ध है, शब्द-सूची (वोकैब्युलरी/कैरेक्टर्स) vocabulary वैरिएबल में है, और हाइपरपैरामीटर्स chars_window और step की वैल्यू क्रमशः 20 और 3 दी गई है। इसका मतलब है कि 20 कैरेक्टर्स की सीक्वेंस अगला कैरेक्टर प्रेडिक्ट करने के लिए उपयोग होगी, और हर इटरेशन में विंडो 3 कैरेक्टर्स से शिफ्ट होगी.
साथ ही, पैकेज pandas को pd नाम से एनवायरनमेंट में लोड कर दिया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)
अभ्यास निर्देश
- लाइन ब्रेक के अनुसार टेक्स्ट को स्प्लिट करें ताकि वाक्यों पर लूप चल सके.
- वाक्य के अंत तक,
chars_windowघटाकर, लूप चलाएँ. - जिस हिस्से में
chars_windowकैरेक्टर्स हों, उसेsentencesवैरिएबल में append करें और उसके अगले कैरेक्टर कोnext_charsवैरिएबल में append करें. - प्राप्त वेक्टरों का उपयोग करके
pd.DataFrame()बनाएँ और उसकी शुरुआती पंक्तियाँ प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
# Get 20 previous chars and next char; then shift by step
for i in range(0, len(sentence) - ____, step):
sentences.append(sentence[i:i + ____])
next_chars.append(sentence[____ + chars_window])
# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})
# Print the initial rows
print(df.head())