НачатьНачать бесплатно

Очистка текстовых данных

Неструктурированный текст нельзя напрямую использовать в большинстве аналитических задач. Чтобы преобразовать длинную произвольную строку в набор числовых столбцов подходящего формата для модели машинного обучения, необходимо выполнить несколько шагов. Первый из них — стандартизация данных и удаление символов, которые могут вызвать проблемы на дальнейших этапах аналитического конвейера.

В этой главе вы будете работать с новым набором данных, содержащим инаугурационные речи президентов США. Он загружен в переменную speech_df, а сами речи хранятся в столбце text.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the first 5 rows of the text column
print(____)
Редактировать и запускать код