Базовые признаки текста
После того как текст очищен и приведён к стандартному виду, можно приступать к созданию признаков на его основе. Самые базовые характеристики произвольного текста — это его размер: длина в символах и количество слов. В этом упражнении (и во всей оставшейся части главы) вы будете работать со столбцом очищенного текста (text_clean), который вы создали в предыдущем упражнении.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Запишите длину каждой речи в символах в столбец
char_count. - Запишите количество слов в каждой речи в столбец
word_count. - Запишите среднюю длину слова в каждой речи в столбец
avg_word_length.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])