Se débarrasser des couleurs superflues

Vous pourriez vouloir comparer la relation entre CO et NO₂ selon les villes à l’aide d’un simple nuage de points, en utilisant la couleur pour différencier les données de chaque ville.

Scatter plot of CO and NO2 with lots of overlapping plots

Malheureusement, le graphique obtenu est très confus. Il est difficile de distinguer les différences entre les villes, car il faut différencier des couleurs proches. Il s’avère que, parfois, la meilleure palette de couleurs pour votre graphique, c’est l’absence de couleur.

Pour remédier à ce graphique difficile à lire, supprimez la composante couleur et créez des facettes par ville. Le résultat sera peut‑être moins esthétique, mais ce sera un bien meilleur outil pour déchiffrer les différences.

Cet exercice fait partie du cours

<cours>Améliorer vos visualisations de données en Python</cours>

Instructions de l’exercice

Pour configurer un graphique avec des facettes par city, passez les données pollution à la fonction de tracé, mappez city aux colonnes et définissez une grille de trois colonnes.
Utilisez la fonction g.map() pour appliquer un scatterplot() sur la grille avec la même esthétique que le nuage de points d’origine, mais sans l’argument hue.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Hard to read scatter of CO and NO2 w/ color mapped to city
# sns.scatterplot('CO', 'NO2',
#                 alpha = 0.2,
#                 hue = 'city',
#                 data = pollution)

# Setup a facet grid to separate the cities apart
g = sns.FacetGrid(data = ____,
                  col = '____',
                  col_wrap = ____)

# Map sns.scatterplot to create separate city scatter plots
g.map(sns.____, 'CO', 'NO2', alpha = 0.2)
plt.show()

Modifier et exécuter le code

Cet exercice fait partie du cours

<cours>Améliorer vos visualisations de données en Python</cours>

IntermédiaireNiveau de compétence

4.7+

Commencer le cours gratuitement

Comment montrer l’ensemble de vos données tout en veillant à ce que le public ne passe pas à côté d’un point essentiel ? Nous expliquons ici comment guider l’attention grâce à des mises en évidence basées sur la couleur et du texte. Nous présentons aussi un jeu de données sur les principaux polluants aux États‑Unis.

Exercise 1: Mettre en valeur les données Exercise 2: Coder en dur une mise en évidence Exercise 3: Créer un surlignage par programmation Exercise 4: Comparer des groupes Exercise 5: Comparer avec deux KDE Exercise 6: Améliorer vos KDE Exercise 7: Beeswarms Exercise 8: Annotations Exercise 9: Une annotation textuelle simple Exercise 10: Annotations avec flèches Exercise 11: Combiner annotations et couleur

La couleur est un outil puissant pour encoder des valeurs en visualisation de données. Mais ce pouvoir s’accompagne de risques. Dans ce chapitre, nous expliquons comment choisir une palette de couleurs adaptée à votre visualisation en fonction du type de données représenté.

Exercise 1: La couleur dans les visualisations Exercise 2: Se débarrasser des couleurs superflues

Exercice actuel

Exercise 3: Corriger les diagrammes en barres de Seaborn Exercise 4: Palettes de couleurs continues Exercise 5: Créer une palette continue personnalisée Exercise 6: Personnaliser une carte thermique à palette divergente Exercise 7: Adapter votre palette au contexte Exercise 8: Palettes catégorielles Exercise 9: Utiliser une palette catégorielle personnalisée Exercise 10: Gérer un trop grand nombre de catégories Exercise 11: Colorier des catégories ordinales Exercise 12: Choisir la bonne variable à encoder par la couleur

L’incertitude est omniprésente en data science, mais elle est souvent absente des visualisations alors qu’elle devrait y figurer. Ici, nous revenons sur la notion d’intervalle de confiance et sur la façon de le représenter, à la fois pour des estimations ponctuelles et des fonctions continues. Nous abordons également la technique de rééchantillonnage bootstrap pour évaluer l’incertitude et comment la visualiser correctement.

Exercise 1: Intervalles d’estimation ponctuelle Exercise 2: Intervalles de confiance de base Exercise 3: Annoter des intervalles de confiance Exercise 4: Bandes de confiance Exercise 5: Créer une bande de confiance Exercise 6: Séparer de nombreuses bandes Exercise 7: Nettoyer les bandes en cas de chevauchements Exercise 8: Au-delà de 95 %Exercise 9: Intervalles à 90, 95 et 99 %Exercise 10: Bandes à 90 et 95 %Exercise 11: Utiliser l’épaisseur des bandes plutôt que la couleur Exercise 12: Visualiser le bootstrap Exercise 13: L’histogramme du bootstrap Exercise 14: Régressions bootstrapées Exercise 15: Beaucoup de bootstraps avec des beeswarms

La visualisation est souvent enseignée isolément, avec des bonnes pratiques présentées de manière générale. En réalité, vous devrez parfois assouplir les règles selon les contextes. Des visualisations exploratoires parfois brouillonnes jusqu’au réglage fin des tailles de police de votre livrable final : dans ce chapitre, nous voyons comment optimiser vos visualisations à chaque étape d’un flux de travail en data science.

Exercise 1: Premières explorations Exercise 2: Examen des données des marchés fermiers Exercise 3: Matrice de nuages de points des colonnes numériques Exercise 4: Approfondir avec des transformations de base Exercise 5: Explorer les tendances Exercise 6: La latitude est-elle liée au nombre de mois d’ouverture ?Exercise 7: Quel État est le plus favorable aux marchés ?Exercise 8: Popularité des produits vendus par État Exercise 9: Rendre vos visualisations efficaces Exercise 10: Empiler pour repérer les tendances Exercise 11: Utiliser un graphique comme légende Exercise 12: Ajuster vos graphiques Exercise 13: Nettoyer l’arrière-plan Exercise 14: Remixer un graphique Exercise 15: Améliorer la lisibilité Exercise 16: Bravo !