Začněte nyníZačněte zdarma

Základní příznaky z textu

Jakmile je text vyčištěný a standardizovaný, můžeš začít z dat vytvářet příznaky. Nejzákladnější informace, které z volného textu zjistíš, se týkají jeho rozsahu – například délky nebo počtu slov. V tomto cvičení (a ve zbytku kapitoly) budeš pracovat s vyčištěným sloupcem textu (text_clean), který jsi vytvořil/a v předchozím cvičení.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Do sloupce char_count zaznamenej počet znaků každého projevu.
  • Do sloupce word_count zaznamenej počet slov každého projevu.
  • Do sloupce avg_word_length zaznamenej průměrnou délku slova v každém projevu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Upravit a spustit kód