or
Acest exercițiu face parte din cursul
În acest capitol, vei învăța cum pot fi folosite rezumatele numerice și grafice pentru a evalua informal dacă datele conțin puncte neobișnuite. Vei aplica o procedură statistică numită testul Grubbs pentru a verifica dacă un punct este o valoare extremă și vei afla despre algoritmul Seasonal-Hybrid ESD, care poate ajuta la identificarea valorilor extreme în cazul seriilor de timp.
În acest capitol, vei învăța cum să calculezi distanța față de cei mai apropiați k vecini și factorul local de devianță, folosite pentru a construi scoruri continue de anomalie pentru fiecare punct de date atunci când datele au mai multe atribute. Vei înțelege diferența dintre anomaliile locale și cele globale și cum pot ajuta cei doi algoritmi în fiecare caz.
Distanța față de cei mai apropiați k vecini și factorul local de devianță utilizează distanța sau densitatea relativă a vecinilor cei mai apropiați pentru a scora fiecare punct. În acest capitol, vei explora o abordare alternativă bazată pe arbori, numită pădure de izolare – o metodă rapidă și robustă de detectare a anomaliilor, care măsoară cât de ușor pot fi separate punctele prin împărțirea aleatorie a datelor în regiuni din ce în ce mai mici.
Ai explorat deja câțiva algoritmi diferiți pentru scorarea anomaliilor. În acest capitol final, vei învăța să compari performanța de detecție a algoritmilor în situațiile în care anomaliile sunt etichetate. Vei calcula și interpreta statisticile de precizie și recuperare pentru un scor de anomalie și vei afla cum să adaptezi algoritmii astfel încât să poată gestiona date cu atribute categoriale.
Exercițiul curent