Zacznij terazZacznij za darmo

Porządkowanie tekstu

Nieustrukturyzowane dane tekstowe nie mogą być bezpośrednio wykorzystane w większości analiz. Aby przejść od długiego, swobodnego ciągu znaków do zestawu kolumn numerycznych w odpowiednim formacie, który można podać modelowi uczenia maszynowego, trzeba wykonać kilka kroków. Pierwszym z nich jest standaryzacja danych i usunięcie znaków, które mogłyby powodować problemy w dalszej części potoku analitycznego.

W tym rozdziale będziesz pracować z nowym zbiorem danych zawierającym przemówienia inauguracyjne prezydentów Stanów Zjednoczonych, wczytanym jako speech_df. Treści przemówień znajdziesz w kolumnie text.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the first 5 rows of the text column
print(____)
Edytuj i uruchom kod