Filtrera på svarslängd
För att bättre förstå resenärernas upplevelser på San Francisco Airport skickade kvalitetssäkringsavdelningen ut ett kvalitativt frågeformulär till alla resenärer som gett flygplatsen lägsta möjliga betyg i samtliga kategorier. Syftet är att identifiera gemensamma mönster i vad resenärerna säger om flygplatsen.
Deras svar finns lagrade i kolumnen survey_response. Vid en närmare granskning märker du att en del svar är så korta att de knappt innehåller något av värde. I den här övningen ska du isolera svaren med fler än 40 tecken och sedan verifiera med en assert-sats att din nya DataFrame bara innehåller svar med 40 tecken eller mer.
DataFramen airlines finns i din miljö och pandas är importerat som pd.
Den här övningen är en del av kursen
Datarensning i Python
Övningsinstruktioner
- Använd DataFramen
airlinesoch beräkna längden på varje svar i kolumnensurvey_responsemed.str.len(). Spara resultatet iresp_length. - Filtrera raderna i
airlinesdärresp_lengthär högre än40. - Kontrollera med en
assert-sats att det kortaste svaret iairlines_surveynu är längre än40tecken.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Store length of each row in survey_response column
resp_length = ____
# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]
# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____
# Print new survey_response column
print(airlines_survey['survey_response'])