Porządkowanie tekstu
Nieustrukturyzowane dane tekstowe nie mogą być bezpośrednio wykorzystane w większości analiz. Aby przejść od długiego, swobodnego ciągu znaków do zestawu kolumn numerycznych w odpowiednim formacie, który można podać modelowi uczenia maszynowego, trzeba wykonać kilka kroków. Pierwszym z nich jest standaryzacja danych i usunięcie znaków, które mogłyby powodować problemy w dalszej części potoku analitycznego.
W tym rozdziale będziesz pracować z nowym zbiorem danych zawierającym przemówienia inauguracyjne prezydentów Stanów Zjednoczonych, wczytanym jako speech_df. Treści przemówień znajdziesz w kolumnie text.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the first 5 rows of the text column
print(____)