विवरणात्मकता बनाए रखें
San Francisco Airport में यात्रियों के अनुभवों को बेहतर समझने के लिए, क्वालिटी एश्योरेंस विभाग ने उन सभी यात्रियों को एक गुणात्मक प्रश्नावली भेजी जिन्होंने सभी श्रेणियों में हवाईअड्डे को सबसे कम स्कोर दिया था. इस प्रश्नावली का उद्देश्य यह पहचानना है कि यात्री हवाईअड्डे के बारे में क्या कह रहे हैं और उसमें आम पैटर्न क्या हैं.
उनकी प्रतिक्रियाएँ survey_response कॉलम में संग्रहीत हैं. ध्यान से देखने पर, आपने पाया कि कुछ जवाबों में बिना किसी ठोस सामग्री के संभवतः सबसे कम वर्णों की संख्या दी गई थी. इस अभ्यास में, आप उन प्रतिक्रियाओं को अलग करेंगे जिनकी कैरेक्टर काउंट 40 से अधिक है, और assert स्टेटमेंट का उपयोग करके सुनिश्चित करेंगे कि आपके नए DataFrame में 40 या उससे अधिक वर्णों वाली प्रतिक्रियाएँ ही हों.
airlines DataFrame आपके वातावरण में उपलब्ध है, और pandas को pd नाम से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा क्लीनिंग
अभ्यास निर्देश
airlinesDataFrame का उपयोग करके,.str.len()सेsurvey_responseकॉलम के प्रत्येक इंस्टेंस की लंबाई निकालकरresp_lengthमें स्टोर करें.resp_lengthजो40से अधिक है, ऐसेairlinesकी पंक्तियाँ अलग करें.- यह Assert करें कि
airlines_surveyमें अबsurvey_responseकी सबसे छोटी लंबाई40से बड़ी है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Store length of each row in survey_response column
resp_length = ____
# Find rows in airlines where resp_length > 40
airlines_survey = airlines[____ > ____]
# Assert minimum survey_response length is > 40
assert ____.str.len().____ > _____
# Print new survey_response column
print(airlines_survey['survey_response'])