Choisir la bonne variable à encoder par la couleur

Vous devez visualiser l’évolution des valeurs de pollution pour Long Beach et des villes voisines au fil du temps. Le code fourni produit le tracé ci-dessous (peu lisible), qui représente les valeurs maximales de pollution (fournies dans max_pollutant_values) avec des barres colorées selon la ville.

Mutlicolor and busy bar plots with four rows corresponding to the four pollutants in dataset

Vous pouvez améliorer cela rapidement avec quelques ajustements. En ne montrant que les villes de la moitié ouest du pays, vous réduirez l’encombrement. Ensuite, en remplaçant l’encodage de couleur de city par year, vous pourrez utiliser une palette ordinale, ce qui évitera au lecteur de consulter sans cesse la légende pour savoir quelle couleur correspond à quelle ville.

Cet exercice fait partie du cours

Améliorer vos visualisations de données en Python

Afficher le cours

Instructions

Supprimez 'Indianapolis', 'Des Moines', 'Cincinnati', 'Houston' du vecteur cities.
Permutez l’encodage des variables city et year.
Utilisez la palette ColorBrewer 'BuGn' pour mapper correctement les couleurs à la nouvelle variable ordinale.

Exercice interactif pratique

Essayez cet exercice en complétant cet exemple de code.

# Reduce to just cities in the western half of US
cities = ['Fairbanks', 'Long Beach', 'Vandenberg Air Force Base', 'Denver', 
          'Indianapolis', 'Des Moines', 'Cincinnati', 'Houston']

# Filter data to desired cities
city_maxes = max_pollutant_values[max_pollutant_values.city.isin(cities)]

# Swap city and year encodings
sns.catplot(x = 'year', hue = 'city',
              y = 'value', row = 'pollutant',    
              # Change palette to one appropriate for ordinal categories
              data = city_maxes, palette = 'muted',
              sharey = False, kind = 'bar')
plt.show()

Modifier et exécuter le code

Cet exercice fait partie du cours

Améliorer vos visualisations de données en Python

IntermédiaireNiveau de compétence

4.8+

Commencer le cours gratuitement

Comment montrer l’ensemble de vos données tout en veillant à ce que le public ne passe pas à côté d’un point essentiel ? Nous expliquons ici comment guider l’attention grâce à des mises en évidence basées sur la couleur et du texte. Nous présentons aussi un jeu de données sur les principaux polluants aux États‑Unis.

Exercise 1: Mettre en valeur les données Exercise 2: Coder en dur une mise en évidence Exercise 3: Créer un surlignage par programmation Exercise 4: Comparer des groupes Exercise 5: Comparer avec deux KDE Exercise 6: Améliorer vos KDE Exercise 7: Beeswarms Exercise 8: Annotations Exercise 9: Une annotation textuelle simple Exercise 10: Annotations avec flèches Exercise 11: Combiner annotations et couleur

La couleur est un outil puissant pour encoder des valeurs en visualisation de données. Mais ce pouvoir s’accompagne de risques. Dans ce chapitre, nous expliquons comment choisir une palette de couleurs adaptée à votre visualisation en fonction du type de données représenté.

Exercise 1: La couleur dans les visualisations Exercise 2: Se débarrasser des couleurs superflues Exercise 3: Corriger les diagrammes en barres de Seaborn Exercise 4: Palettes de couleurs continues Exercise 5: Créer une palette continue personnalisée Exercise 6: Personnaliser une carte thermique à palette divergente Exercise 7: Adapter votre palette au contexte Exercise 8: Palettes catégorielles Exercise 9: Utiliser une palette catégorielle personnalisée Exercise 10: Gérer un trop grand nombre de catégories Exercise 11: Colorier des catégories ordinales Exercise 12: Choisir la bonne variable à encoder par la couleur

Exercice en cours

L’incertitude est omniprésente en data science, mais elle est souvent absente des visualisations alors qu’elle devrait y figurer. Ici, nous revenons sur la notion d’intervalle de confiance et sur la façon de le représenter, à la fois pour des estimations ponctuelles et des fonctions continues. Nous abordons également la technique de rééchantillonnage bootstrap pour évaluer l’incertitude et comment la visualiser correctement.

Exercise 1: Intervalles d’estimation ponctuelle Exercise 2: Intervalles de confiance de base Exercise 3: Annoter des intervalles de confiance Exercise 4: Bandes de confiance Exercise 5: Créer une bande de confiance Exercise 6: Séparer de nombreuses bandes Exercise 7: Nettoyer les bandes en cas de chevauchements Exercise 8: Au-delà de 95 %Exercise 9: Intervalles à 90, 95 et 99 %Exercise 10: Bandes à 90 et 95 %Exercise 11: Utiliser l’épaisseur des bandes plutôt que la couleur Exercise 12: Visualiser le bootstrap Exercise 13: L’histogramme du bootstrap Exercise 14: Régressions bootstrapées Exercise 15: Beaucoup de bootstraps avec des beeswarms

La visualisation est souvent enseignée isolément, avec des bonnes pratiques présentées de manière générale. En réalité, vous devrez parfois assouplir les règles selon les contextes. Des visualisations exploratoires parfois brouillonnes jusqu’au réglage fin des tailles de police de votre livrable final : dans ce chapitre, nous voyons comment optimiser vos visualisations à chaque étape d’un flux de travail en data science.

Exercise 1: Premières explorations Exercise 2: Examen des données des marchés fermiers Exercise 3: Matrice de nuages de points des colonnes numériques Exercise 4: Approfondir avec des transformations de base Exercise 5: Explorer les tendances Exercise 6: La latitude est-elle liée au nombre de mois d’ouverture ?Exercise 7: Quel État est le plus favorable aux marchés ?Exercise 8: Popularité des produits vendus par État Exercise 9: Rendre vos visualisations efficaces Exercise 10: Empiler pour repérer les tendances Exercise 11: Utiliser un graphique comme légende Exercise 12: Ajuster vos graphiques Exercise 13: Nettoyer l’arrière-plan Exercise 14: Remixer un graphique Exercise 15: Améliorer la lisibilité Exercise 16: Bravo !