Städa upp din text
Ostrukturerad textdata kan inte användas direkt i de flesta analyser. Det krävs flera steg för att gå från en lång fritext till en uppsättning numeriska kolumner i rätt format som kan matas in i en maskininlärningsmodell. Det första steget i den här processen är att standardisera datan och ta bort tecken som kan orsaka problem längre fram i din analytiska pipeline.
I det här kapitlet arbetar du med en ny datamängd som innehåller installationstal från USA:s presidenter, inläst som speech_df, med talen lagrade i kolumnen text.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the first 5 rows of the text column
print(____)