ПочатиПочніть безкоштовно

Очищення тексту

Неструктурований текст не можна напряму використовувати в більшості аналізів. Потрібно виконати кілька кроків, щоб перетворити довгий довільний рядок на набір числових стовпців у форматі, придатному для подальшого використання моделлю машинного навчання. Перший крок цього процесу — стандартизувати дані та прибрати символи, які згодом можуть спричинити проблеми у вашому аналітичному конвеєрі.

У цьому розділі ви працюватимете з новим набором даних, що містить інавгураційні промови президентів США, завантаженим у speech_df, де самі промови зберігаються в стовпці text.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the first 5 rows of the text column
print(____)
Редагувати та запускати код