Zacznij terazZacznij za darmo

Wyodrębnianie wzorców z tekstu

Kolumna Length w zbiorze danych hiking zawiera ciągi znaków, w których ukryty jest dystans trasy w milach. Wyodrębnimy ten dystans za pomocą wyrażeń regularnych, a następnie użyjemy funkcji lambda w pandas, aby zastosować to wyodrębnianie do całego DataFrame.

To ćwiczenie jest częścią kursu

Preprocessing w uczeniu maszynowym w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Przeszukaj tekst przekazany w argumencie length w poszukiwaniu liczb i cyfr dziesiętnych, używając odpowiedniego wzorca.
  • Wyodrębnij dopasowany wzorzec i przekształć go na liczbę zmiennoprzecinkową.
  • Zastosuj funkcję return_mileage() do każdego wiersza w kolumnie hiking["Length"].

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Write a pattern to extract numbers and decimals
def return_mileage(length):
    
    # Search the text for matches
    mile = re.____(____, ____)
    
    # If a value is returned, use group(0) to return the found value
    if mile is not None:
        return float(____)
        
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())
Edytuj i uruchom kod