High-level टेक्स्ट फीचर्स
टेक्स्ट को साफ़ और मानकीकृत करने के बाद आप डेटा से फीचर्स बनाना शुरू कर सकते हैं. फ्री-फॉर्म टेक्स्ट के बारे में आप जो सबसे बुनियादी जानकारी निकाल सकते हैं, वह उसका आकार है, जैसे उसकी लंबाई और शब्दों की संख्या. इस अभ्यास (और इस अध्याय के बाकी हिस्सों) में, आप पिछले अभ्यास में बनाई गई क्लीन/ट्रांसफॉर्म की हुई टेक्स्ट कॉलम (text_clean) पर ही ध्यान देंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
अभ्यास निर्देश
- हर भाषण की कैरेक्टर लंबाई
char_countकॉलम में रिकॉर्ड करें. - हर भाषण का शब्द-गणना
word_countकॉलम में रिकॉर्ड करें. - हर भाषण की औसत शब्द-लंबाई
avg_word_lengthकॉलम में रिकॉर्ड करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])