Extrakce vzorů z řetězců
Sloupec Length v datasetu hiking obsahuje řetězce, ve kterých je skrytá vzdálenost trasy v mílích. Tuto vzdálenost extrahujeme pomocí regulárních výrazů a pak použijeme lambda funkci v pandas, abychom extrakci aplikovali na celý DataFrame.
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Prohledej text v argumentu
lengtha vyhledej čísla a desetinné hodnoty pomocí vhodného vzoru. - Extrahuj nalezený vzor a převeď ho na float.
- Aplikuj funkci
return_mileage()na každý řádek sloupcehiking["Length"].
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Write a pattern to extract numbers and decimals
def return_mileage(length):
# Search the text for matches
mile = re.____(____, ____)
# If a value is returned, use group(0) to return the found value
if mile is not None:
return float(____)
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())