ÎncepețiÎncepe gratuit

Caracteristici generale ale textului

După ce textul a fost curățat și standardizat, poți începe să creezi caracteristici din date. Cele mai fundamentale informații pe care le poți calcula despre un text liber sunt dimensiunea sa, cum ar fi lungimea și numărul de cuvinte. În acest exercițiu (și în restul acestui capitol), te vei concentra pe coloana de text curățat/transformat (text_clean) pe care ai creat-o în exercițiul anterior.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Înregistrează lungimea în caractere a fiecărui discurs în coloana char_count.
  • Înregistrează numărul de cuvinte al fiecărui discurs în coloana word_count.
  • Înregistrează lungimea medie a cuvintelor din fiecare discurs în coloana avg_word_length.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Editează și rulează codul