Textegenskaper på hög nivå
När texten har rensats och standardiserats kan du börja skapa särdrag från datan. Den mest grundläggande informationen du kan beräkna om fritext är dess storlek – till exempel längd och antal ord. I den här övningen (och resten av kapitlet) arbetar du med den rensade textkolumnen (text_clean) som du skapade i föregående övning.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Övningsinstruktioner
- Registrera teckenlängden för varje tal i kolumnen
char_count. - Registrera ordantalet för varje tal i kolumnen
word_count. - Registrera den genomsnittliga ordlängden för varje tal i kolumnen
avg_word_length.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])