or
Den här övningen är en del av kursen
I det här kapitlet lär du dig hur numeriska och grafiska sammanfattningar kan användas för att informellt bedöma om data innehåller ovanliga punkter. Du använder ett statistiskt förfarande som kallas Grubbs test för att kontrollera om en punkt är ett extremvärde, och lär dig om algoritmen Seasonal-Hybrid ESD, som kan hjälpa till att identifiera extremvärden när data utgör en tidsserie.
I det här kapitlet lär du dig hur man beräknar avståndet till de k närmaste grannarna och den lokala extremvärdesdetektor (local outlier factor), som används för att konstruera kontinuerliga avvikelsepoäng för varje datapunkt när data har flera egenskaper. Du lär dig skillnaden mellan lokala och globala avvikelser, och hur de två algoritmerna kan vara användbara i respektive fall.
Avståndet till k närmaste grannar och lokal extremvärdesdetektor använder avståndet eller den relativa densiteten hos de närmaste grannarna för att poängsätta varje punkt. I det här kapitlet utforskar du ett alternativt trädbaserat tillvägagångssätt som kallas isolation forest – en snabb och robust metod för avvikelsedetektering som mäter hur lätt punkter kan separeras genom att slumpmässigt dela upp data i allt mindre regioner.
Nu har du bekantat dig med ett antal olika algoritmer för avvikelsepoängsättning. I det här avslutande kapitlet lär du dig att jämföra algoritmernas detekteringsprestanda i fall där märkta avvikelser finns tillgängliga. Du lär dig att beräkna och tolka precision och återanrop för en avvikelsepoäng, samt hur algoritmerna kan anpassas för att hantera data med kategoriska egenskaper.
Aktuell övning