Caracteristici generale ale textului
După ce textul a fost curățat și standardizat, poți începe să creezi caracteristici din date. Cele mai fundamentale informații pe care le poți calcula despre un text liber sunt dimensiunea sa, cum ar fi lungimea și numărul de cuvinte. În acest exercițiu (și în restul acestui capitol), te vei concentra pe coloana de text curățat/transformat (text_clean) pe care ai creat-o în exercițiul anterior.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Înregistrează lungimea în caractere a fiecărui discurs în coloana
char_count. - Înregistrează numărul de cuvinte al fiecărui discurs în coloana
word_count. - Înregistrează lungimea medie a cuvintelor din fiecare discurs în coloana
avg_word_length.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])