or
Cet exercice fait partie du cours
Dans ce chapitre, vous verrez comment des résumés numériques et graphiques peuvent servir à évaluer de manière informelle si les données contiennent des points inhabituels. Vous utiliserez une procédure statistique appelée test de Grubbs pour vérifier si un point est une valeur aberrante, et découvrirez l’algorithme Seasonal-Hybrid ESD, utile pour repérer des valeurs aberrantes lorsque les données forment une série chronologique.
Dans ce chapitre, vous apprendrez à calculer la distance des k plus proches voisins (k-nearest neighbors) et le facteur d’isolement local (local outlier factor), qui servent à construire des scores d’anomalie continus pour chaque point lorsque les données ont plusieurs variables. Vous verrez la différence entre anomalies locales et globales et comment ces deux algorithmes peuvent aider dans chaque cas.
La distance des k plus proches voisins et le facteur d’isolement local s’appuient sur la distance ou la densité relative des voisins les plus proches pour attribuer un score à chaque point. Dans ce chapitre, vous explorerez une approche alternative basée sur des arbres, appelée isolation forest, une méthode rapide et robuste de détection d’anomalies qui mesure à quel point il est facile d’isoler les points en scindant aléatoirement les données en régions de plus en plus petites.
Vous avez maintenant découvert plusieurs algorithmes de notation d’anomalies. Dans ce dernier chapitre, vous apprendrez à comparer les performances de détection des algorithmes lorsque des anomalies étiquetées sont disponibles. Vous calculerez et interpréterez la précision (precision) et le rappel (recall) d’un score d’anomalie, et verrez comment adapter les algorithmes pour gérer des données comportant des variables catégorielles.
Exercice actuel