or
Cette activité fait partie du cours
Dans ce chapitre, vous verrez ce qu'est l'ingénierie des caractéristiques et comment commencer à l'appliquer à des données réelles. Vous chargerez, explorerez et visualiserez un ensemble de réponses d'enquête et, ce faisant, vous apprendrez ses types de données sous-jacents et pourquoi ils influencent la façon de concevoir vos caractéristiques. Avec le module pandas, vous créerez de nouvelles caractéristiques à partir de colonnes à la fois catégorielles et continues.
Ce chapitre vous présente la réalité des données incomplètes et désordonnées. Vous apprendrez à repérer où vos données comportent des valeurs manquantes et explorerez plusieurs façons de les traiter. Vous utiliserez aussi des techniques de manipulation de chaînes pour retirer les caractères indésirables dans votre ensemble de données.
Dans ce chapitre, vous vous concentrerez sur l'analyse de la distribution sous-jacente de vos données et sur l'impact potentiel sur votre pipeline de Machine Learning. Vous apprendrez à traiter des données asymétriques et des situations où des valeurs aberrantes nuisent à votre analyse.
Enfin, dans ce chapitre, vous travaillerez avec des données textuelles non structurées et verrez comment en extraire des caractéristiques colonnes à partir d'un corpus. Vous comparerez différentes approches selon la quantité de contexte extraite d'un texte et apprendrez à trouver un équilibre entre le contexte nécessaire et la création d'un trop grand nombre de caractéristiques.
Exercice en cours