Základní příznaky z textu
Jakmile je text vyčištěný a standardizovaný, můžeš začít z dat vytvářet příznaky. Nejzákladnější informace, které z volného textu zjistíš, se týkají jeho rozsahu – například délky nebo počtu slov. V tomto cvičení (a ve zbytku kapitoly) budeš pracovat s vyčištěným sloupcem textu (text_clean), který jsi vytvořil/a v předchozím cvičení.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Pokyny k cvičení
- Do sloupce
char_countzaznamenej počet znaků každého projevu. - Do sloupce
word_countzaznamenej počet slov každého projevu. - Do sloupce
avg_word_lengthzaznamenej průměrnou délku slova v každém projevu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])