or
Cette activité fait partie du cours
Nous commencerons le cours par une définition de la science des données. Nous verrons le déroulement type d'un projet et comment la science des données s'applique à des problèmes concrets. Nous terminerons le chapitre avec un tour d'horizon des différents rôles au sein du domaine.
Maintenant que nous comprenons le déroulement d'un projet en science des données, approfondissons la première étape : la collecte et le stockage des données. Nous verrons les différentes sources dont vous pouvez tirer des données, à quoi ressemblent ces données, comment les stocker une fois recueillies et comment un pipeline de données peut automatiser le processus.
La préparation des données est essentielle : les spécialistes passent 80 % de leur temps à nettoyer et à transformer les données, et seulement 20 % à les analyser. Ce chapitre vous montrera comment diagnostiquer les problèmes dans vos données et traiter les valeurs manquantes et les valeurs aberrantes. Vous apprendrez ensuite la visualisation, un autre outil clé pour explorer vos données et communiquer vos conclusions.
Dans ce dernier chapitre, nous parlerons d'expérimentation et de prédiction! Nous commencerons par les expériences avec les tests A/B, puis passerons à la prévision de séries chronologiques pour apprendre à prédire des événements futurs. Enfin, nous terminerons avec le Machine Learning, en abordant l'apprentissage supervisé et le regroupement (clustering).
Exercice en cours