or
Den här övningen är en del av kursen
I det här kapitlet utforskar du vad särdragshantering är och hur du kommer igång med att tillämpa det på verkliga data. Du läser in, utforskar och visualiserar ett enkätdataset och lär dig därigenom om dess underliggande datatyper och varför dessa påverkar hur du bör skapa dina särdrag. Med hjälp av pandas skapar du nya särdrag från både kategoriska och kontinuerliga kolumner.
Det här kapitlet introducerar dig till verkligheten med rörig och ofullständig data. Du lär dig att hitta var din data saknar värden och utforskar flera olika sätt att hantera det. Du använder också strängmanipulering för att hantera oönskade tecken i ditt dataset.
I det här kapitlet fokuserar du på att analysera den underliggande fördelningen av dina data och om den kan påverka din maskininlärningspipeline. Du lär dig att hantera skev data och situationer där extremvärden kan påverka din analys negativt.
I det avslutande kapitlet arbetar du med ostrukturerade textdata och lär dig hur du kan skapa kolumnbaserade särdrag från ett textkorpus. Du jämför hur olika metoder påverkar hur mycket kontext som extraheras från en text, och hur du balanserar behovet av kontext mot risken att skapa för många särdrag.
Aktuell övning