Rester descriptif
Pour mieux comprendre l’expérience des voyageurs à l’aéroport de San Francisco, l’équipe d’assurance qualité a envoyé un questionnaire qualitatif à toutes les personnes qui ont attribué la pire note à l’aéroport dans toutes les catégories. L’objectif est d’identifier les tendances récurrentes dans les commentaires des voyageurs sur l’aéroport.
Leurs réponses se trouvent dans la colonne survey_response. En y regardant de plus près, vous constatez que certaines réponses utilisent le minimum de caractères possible et n’apportent pas grand-chose. Dans cet exercice, vous allez isoler les réponses dont le nombre de caractères est supérieur à 40, puis vérifier que votre nouveau DataFrame ne contient que des réponses de 40 caractères ou plus à l’aide d’une instruction assert.
Le DataFrame airlines est déjà dans votre environnement, et pandas est importé sous le nom pd.
Cette activité fait partie du cours
Nettoyage des données en Python
Instructions de l’exercice
- À partir du DataFrame
airlines, stockez la longueur de chaque valeur de la colonnesurvey_responsedansresp_lengthen utilisant.str.len(). - Isolez les lignes de
airlinesdontresp_lengthest supérieur à40. - Vérifiez, avec
assert, que la plus petite longueur desurvey_responsedansairlines_surveyest maintenant supérieure à40.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Store length of each row in survey_response column
resp_length = ____
# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]
# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____
# Print new survey_response column
print(airlines_survey['survey_response'])