ÎncepețiÎncepe gratuit

Curățarea textului

Datele text nestructurate nu pot fi folosite direct în majoritatea analizelor. Sunt necesari mai mulți pași pentru a transforma un șir lung de text liber într-un set de coloane numerice, în formatul potrivit pentru a fi preluat de un model de machine learning. Primul pas al acestui proces este standardizarea datelor și eliminarea oricăror caractere care ar putea cauza probleme mai târziu în fluxul tău de analiză.

În acest capitol vei lucra cu un nou set de date care conține discursurile inaugurale ale președinților Statelor Unite, încărcat ca speech_df, cu discursurile stocate în coloana text.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Print the first 5 rows of the text column
print(____)
Editează și rulează codul