Začněte nyníZačněte zdarma

Dostatečně popisné odpovědi

Aby oddělení kontroly kvality lépe porozumělo zkušenostem cestujících na letišti v San Franciscu, rozeslalo kvalitativní dotazník všem cestujícím, kteří ohodnotili letiště nejhorším možným skóre ve všech kategoriích. Cílem je odhalit opakující se vzory v tom, co cestující o letišti říkají.

Jejich odpovědi jsou uloženy ve sloupci survey_response. Při bližším pohledu si všimneš, že některé odpovědi obsahují jen minimální počet znaků a prakticky žádnou podstatnou informaci. V tomto cvičení vyfiltrujeme odpovědi s počtem znaků vyšším než 40 a pomocí příkazu assert ověříme, že nový DataFrame obsahuje pouze odpovědi s 40 a více znaky.

DataFrame airlines je dostupný v prostředí a pandas je naimportován jako pd.

Toto cvičení je součástí kurzu

Čištění dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Pomocí .str.len() zjisti délku každé hodnoty ve sloupci survey_response v DataFramu airlines a výsledek ulož do resp_length.
  • Vyfiltruj z DataFramu airlines řádky, kde je resp_length vyšší než 40.
  • Pomocí příkazu assert ověř, že nejkratší odpověď ve sloupci survey_response v DataFramu airlines_survey má nyní více než 40 znaků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Store length of each row in survey_response column
resp_length = ____

# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]

# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____

# Print new survey_response column
print(airlines_survey['survey_response'])
Upravit a spustit kód