Szczegółowe odpowiedzi
Aby lepiej zrozumieć doświadczenia podróżnych na lotnisku w San Francisco, dział kontroli jakości wysłał ankietę jakościową do wszystkich osób, które przyznały lotnisku najniższe oceny we wszystkich kategoriach. Celem ankiety jest identyfikacja powtarzających się wzorców w opiniach podróżnych.
Odpowiedzi są przechowywane w kolumnie survey_response. Po bliższym przyjrzeniu się danym okazało się, że część odpowiedzi jest bardzo krótka i mało treściwa. W tym ćwiczeniu wyodrębnisz odpowiedzi o liczbie znaków większej niż 40 i za pomocą instrukcji assert upewnisz się, że nowy DataFrame zawiera odpowiedzi o długości co najmniej 40 znaków.
DataFrame airlines jest dostępny w środowisku, a biblioteka pandas została zaimportowana jako pd.
To ćwiczenie jest częścią kursu
Czyszczenie danych w Pythonie
Instrukcje do ćwiczenia
- Korzystając z DataFrame
airlines, oblicz długość każdej odpowiedzi w kolumniesurvey_responseza pomocą.str.len()i zapisz wynik w zmiennejresp_length. - Wyodrębnij wiersze z
airlines, dla którychresp_lengthjest większe niż40. - Za pomocą instrukcji
assertsprawdź, czy minimalna długość odpowiedzi w kolumniesurvey_responsew DataFrameairlines_surveyjest teraz większa niż40.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Store length of each row in survey_response column
resp_length = ____
# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]
# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____
# Print new survey_response column
print(airlines_survey['survey_response'])