НачатьНачать бесплатно

Базовые признаки текста

После того как текст очищен и приведён к стандартному виду, можно приступать к созданию признаков на его основе. Самые базовые характеристики произвольного текста — это его размер: длина в символах и количество слов. В этом упражнении (и во всей оставшейся части главы) вы будете работать со столбцом очищенного текста (text_clean), который вы создали в предыдущем упражнении.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Запишите длину каждой речи в символах в столбец char_count.
  • Запишите количество слов в каждой речи в столбец word_count.
  • Запишите среднюю длину слова в каждой речи в столбец avg_word_length.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Редактировать и запускать код