Podstawowe cechy tekstu
Gdy tekst jest już wyczyszczony i ujednolicony, możesz przystąpić do tworzenia cech na jego podstawie. Najbardziej podstawowe informacje, jakie możesz wyciągnąć z tekstu swobodnego, dotyczą jego rozmiaru – np. długości czy liczby słów. W tym ćwiczeniu (i w pozostałych ćwiczeniach tego rozdziału) skupisz się na kolumnie z oczyszczonym tekstem (text_clean), którą utworzyłeś w poprzednim ćwiczeniu.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Zapisz długość każdego przemówienia (w znakach) w kolumnie
char_count. - Zapisz liczbę słów każdego przemówienia w kolumnie
word_count. - Zapisz średnią długość słowa dla każdego przemówienia w kolumnie
avg_word_length.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])