Zacznij terazZacznij za darmo

Podstawowe cechy tekstu

Gdy tekst jest już wyczyszczony i ujednolicony, możesz przystąpić do tworzenia cech na jego podstawie. Najbardziej podstawowe informacje, jakie możesz wyciągnąć z tekstu swobodnego, dotyczą jego rozmiaru – np. długości czy liczby słów. W tym ćwiczeniu (i w pozostałych ćwiczeniach tego rozdziału) skupisz się na kolumnie z oczyszczonym tekstem (text_clean), którą utworzyłeś w poprzednim ćwiczeniu.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zapisz długość każdego przemówienia (w znakach) w kolumnie char_count.
  • Zapisz liczbę słów każdego przemówienia w kolumnie word_count.
  • Zapisz średnią długość słowa dla każdego przemówienia w kolumnie avg_word_length.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Edytuj i uruchom kod