Kom igångKom igång gratis

Städa upp din text

Ostrukturerad textdata kan inte användas direkt i de flesta analyser. Det krävs flera steg för att gå från en lång fritext till en uppsättning numeriska kolumner i rätt format som kan matas in i en maskininlärningsmodell. Det första steget i den här processen är att standardisera datan och ta bort tecken som kan orsaka problem längre fram i din analytiska pipeline.

I det här kapitlet arbetar du med en ny datamängd som innehåller installationstal från USA:s presidenter, inläst som speech_df, med talen lagrade i kolumnen text.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the first 5 rows of the text column
print(____)
Redigera och kör kod