Извлечение шаблонов из строк
Столбец Length в наборе данных hiking содержит строки, в которых указана протяжённость маршрута в милях. Мы извлечём это значение с помощью регулярных выражений, а затем применим лямбда-функцию в pandas, чтобы обработать весь DataFrame.
Это упражнение является частью курса
Предобработка данных для машинного обучения на Python
Инструкции к упражнению
- Найдите в аргументе
lengthчисла и десятичные значения, используя подходящий шаблон. - Извлеките найденный шаблон и преобразуйте его в число с плавающей точкой.
- Примените функцию
return_mileage()к каждой строке столбцаhiking["Length"].
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write a pattern to extract numbers and decimals
def return_mileage(length):
# Search the text for matches
mile = re.____(____, ____)
# If a value is returned, use group(0) to return the found value
if mile is not None:
return float(____)
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())