Очищення тексту
Неструктурований текст не можна напряму використовувати в більшості аналізів. Потрібно виконати кілька кроків, щоб перетворити довгий довільний рядок на набір числових стовпців у форматі, придатному для подальшого використання моделлю машинного навчання. Перший крок цього процесу — стандартизувати дані та прибрати символи, які згодом можуть спричинити проблеми у вашому аналітичному конвеєрі.
У цьому розділі ви працюватимете з новим набором даних, що містить інавгураційні промови президентів США, завантаженим у speech_df, де самі промови зберігаються в стовпці text.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the first 5 rows of the text column
print(____)