or
Den här övningen är en del av kursen
I det här kapitlet lär du dig att hantera några av de vanligaste problemen med smutsig data. Du konverterar datatyper, tillämpar intervallbegränsningar för att ta bort framtida datapunkter och tar bort duplicerade datapunkter för att undvika dubbelräkning.
Kategorisk data och textdata kan ofta vara de mest svårhanterliga delarna av en datamängd på grund av sin ostrukturerade natur. I det här kapitlet lär du dig att åtgärda inkonsekvenser med blanksteg och versalisering i kategorietiketter, slå ihop flera kategorier till en och formatera om strängar för enhetlighet.
I det här kapitlet fördjupar du dig i mer avancerade datarensningsproblem, till exempel att säkerställa att vikter anges i kilogram i stället för pund. Du får också värdefulla färdigheter som hjälper dig att kontrollera att värden har lagts till korrekt och att saknade värden inte påverkar dina analyser negativt.
Postlänkning är en kraftfull teknik som används för att sammanfoga flera datamängder, särskilt när värden innehåller stavfel eller olika stavningar. I det här kapitlet lär du dig att länka poster genom att beräkna likheten mellan strängar – sedan använder du dina nya färdigheter för att slå samman två restaurangrecensiondatamängder till en samlad och ren datamängd.
Aktuell övning