Začněte nyníZačněte zdarma

Čištění textu

Nestrukturovaná textová data nelze ve většině analýz použít přímo. Aby bylo možné převést dlouhý volný text na sadu numerických sloupců ve správném formátu, které dokáže zpracovat model strojového učení, je potřeba projít několika kroky. Prvním z nich je standardizace dat a odstranění všech znaků, které by mohly způsobit problémy v dalších fázích analytického procesu.

V této kapitole budeš pracovat s novým datasetem obsahujícím inaugurační projevy prezidentů Spojených států. Dataset je načtený jako speech_df a samotné projevy jsou uložené ve sloupci text.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the first 5 rows of the text column
print(____)
Upravit a spustit kód