Очистка текстовых данных
Неструктурированный текст нельзя напрямую использовать в большинстве аналитических задач. Чтобы преобразовать длинную произвольную строку в набор числовых столбцов подходящего формата для модели машинного обучения, необходимо выполнить несколько шагов. Первый из них — стандартизация данных и удаление символов, которые могут вызвать проблемы на дальнейших этапах аналитического конвейера.
В этой главе вы будете работать с новым набором данных, содержащим инаугурационные речи президентов США. Он загружен в переменную speech_df, а сами речи хранятся в столбце text.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the first 5 rows of the text column
print(____)