Usuwanie tytułów i wyodrębnianie imion
Podczas zbierania metadanych respondentów ankiety w DataFrame airlines pełne imiona i nazwiska respondentów zostały zapisane w kolumnie full_name. Po dokładniejszej analizie okazało się jednak, że wiele z tych nazw poprzedzonych jest tytułami grzecznościowymi, takimi jak "Dr.", "Mr.", "Ms." czy "Miss".
Twoim ostatecznym celem jest utworzenie dwóch nowych kolumn – first_name oraz last_name – zawierających odpowiednio imiona i nazwiska respondentów. Zanim to jednak zrobisz, musisz usunąć tytuły grzecznościowe.
DataFrame airlines jest dostępny w twoim środowisku wraz z biblioteką pandas jako pd.
To ćwiczenie jest częścią kursu
Czyszczenie danych w Pythonie
Instrukcje do ćwiczenia
- Usuń
"Dr.","Mr.","Miss"oraz"Ms."z kolumnyfull_name, zastępując je kolejno pustym ciągiem znaków"". - Uruchom instrukcję
assertz użyciem.str.contains(), która sprawdza, czy kolumnafull_namenadal zawiera którykolwiek z tytułów grzecznościowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Replace "Dr." with empty string ""
airlines['full_name'] = airlines['full_name'].____.____("____","")
# Replace "Mr." with empty string ""
airlines['full_name'] = ____
# Replace "Miss" with empty string ""
____
# Replace "Ms." with empty string ""
____
# Assert that full_name has no honorifics
assert airlines['full_name'].str.contains('Ms.|Mr.|Miss|Dr.').any() == False