Kom igångKom igång gratis

Textegenskaper på hög nivå

När texten har rensats och standardiserats kan du börja skapa särdrag från datan. Den mest grundläggande informationen du kan beräkna om fritext är dess storlek – till exempel längd och antal ord. I den här övningen (och resten av kapitlet) arbetar du med den rensade textkolumnen (text_clean) som du skapade i föregående övning.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Registrera teckenlängden för varje tal i kolumnen char_count.
  • Registrera ordantalet för varje tal i kolumnen word_count.
  • Registrera den genomsnittliga ordlängden för varje tal i kolumnen avg_word_length.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Redigera och kör kod