Dostatečně popisné odpovědi
Aby oddělení kontroly kvality lépe porozumělo zkušenostem cestujících na letišti v San Franciscu, rozeslalo kvalitativní dotazník všem cestujícím, kteří ohodnotili letiště nejhorším možným skóre ve všech kategoriích. Cílem je odhalit opakující se vzory v tom, co cestující o letišti říkají.
Jejich odpovědi jsou uloženy ve sloupci survey_response. Při bližším pohledu si všimneš, že některé odpovědi obsahují jen minimální počet znaků a prakticky žádnou podstatnou informaci. V tomto cvičení vyfiltrujeme odpovědi s počtem znaků vyšším než 40 a pomocí příkazu assert ověříme, že nový DataFrame obsahuje pouze odpovědi s 40 a více znaky.
DataFrame airlines je dostupný v prostředí a pandas je naimportován jako pd.
Toto cvičení je součástí kurzu
Čištění dat v Pythonu
Pokyny k cvičení
- Pomocí
.str.len()zjisti délku každé hodnoty ve sloupcisurvey_responsev DataFramuairlinesa výsledek ulož doresp_length. - Vyfiltruj z DataFramu
airlinesřádky, kde jeresp_lengthvyšší než40. - Pomocí příkazu
assertověř, že nejkratší odpověď ve sloupcisurvey_responsev DataFramuairlines_surveymá nyní více než40znaků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Store length of each row in survey_response column
resp_length = ____
# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]
# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____
# Print new survey_response column
print(airlines_survey['survey_response'])