or
Den här övningen är en del av kursen
I det här kapitlet lär du dig att hantera några av de vanligaste problemen med smutsiga data. Du konverterar datatyper, tillämpar intervallbegränsningar för att ta bort framtida datapunkter och tar bort duplicerade datapunkter för att undvika dubbelräkning.
Kategori- och textdata kan ofta vara de mest ostrukturerade delarna av en datamängd. I det här kapitlet lär du dig att åtgärda inkonsekvent blanksteg och versalisering i kategorietiketter, slå samman flera kategorier till en och formatera om strängar för konsekvens.
I det här kapitlet går du djupare in på avancerade datarensningsproblem, till exempel att säkerställa att vikter anges i kilogram i stället för pund. Du utvecklar också värdefulla färdigheter som hjälper dig att verifiera att värden har lagts till korrekt och att saknade värden inte påverkar dina analyser negativt.
Postlänkning är en kraftfull teknik för att slå samman flera datamängder, särskilt när värden innehåller stavfel eller varianter av samma stavning. I det här kapitlet lär du dig att länka poster genom att beräkna likheten mellan strängar – sedan använder du dina nya kunskaper för att slå samman två restaurangrecensiondatamängder till en ren masterdatamängd.
Aktuell övning