Wyodrębnianie wzorców z tekstu
Kolumna Length w zbiorze danych hiking zawiera ciągi znaków, w których ukryty jest dystans trasy w milach. Wyodrębnimy ten dystans za pomocą wyrażeń regularnych, a następnie użyjemy funkcji lambda w pandas, aby zastosować to wyodrębnianie do całego DataFrame.
To ćwiczenie jest częścią kursu
Preprocessing w uczeniu maszynowym w Pythonie
Instrukcje do ćwiczenia
- Przeszukaj tekst przekazany w argumencie
lengthw poszukiwaniu liczb i cyfr dziesiętnych, używając odpowiedniego wzorca. - Wyodrębnij dopasowany wzorzec i przekształć go na liczbę zmiennoprzecinkową.
- Zastosuj funkcję
return_mileage()do każdego wiersza w kolumniehiking["Length"].
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write a pattern to extract numbers and decimals
def return_mileage(length):
# Search the text for matches
mile = re.____(____, ____)
# If a value is returned, use group(0) to return the found value
if mile is not None:
return float(____)
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())