Čištění textu
Nestrukturovaná textová data nelze ve většině analýz použít přímo. Aby bylo možné převést dlouhý volný text na sadu numerických sloupců ve správném formátu, které dokáže zpracovat model strojového učení, je potřeba projít několika kroky. Prvním z nich je standardizace dat a odstranění všech znaků, které by mohly způsobit problémy v dalších fázích analytického procesu.
V této kapitole budeš pracovat s novým datasetem obsahujícím inaugurační projevy prezidentů Spojených států. Dataset je načtený jako speech_df a samotné projevy jsou uložené ve sloupci text.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the first 5 rows of the text column
print(____)