Виділення шаблонів у рядках
Стовпець Length у наборі даних hiking містить рядки, але всередині цих рядків є значення довжини маршруту в милях. Ми виділимо це значення за допомогою регулярних виразів, а потім застосуємо лямбда-функцію в pandas, щоб виконати виділення для всього датафрейму.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Знайдіть у тексті аргументу
lengthчисла та десяткові дроби, використавши відповідний шаблон. - Видобудьте знайдений збіг і перетворіть його на float.
- Застосуйте функцію
return_mileage()до кожного рядка стовпцяhiking["Length"].
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write a pattern to extract numbers and decimals
def return_mileage(length):
# Search the text for matches
mile = re.____(____, ____)
# If a value is returned, use group(0) to return the found value
if mile is not None:
return float(____)
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())