ПочатиПочніть безкоштовно

Виділення шаблонів у рядках

Стовпець Length у наборі даних hiking містить рядки, але всередині цих рядків є значення довжини маршруту в милях. Ми виділимо це значення за допомогою регулярних виразів, а потім застосуємо лямбда-функцію в pandas, щоб виконати виділення для всього датафрейму.

Ця вправа є частиною курсу

Передобробка для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Знайдіть у тексті аргументу length числа та десяткові дроби, використавши відповідний шаблон.
  • Видобудьте знайдений збіг і перетворіть його на float.
  • Застосуйте функцію return_mileage() до кожного рядка стовпця hiking["Length"].

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Write a pattern to extract numbers and decimals
def return_mileage(length):
    
    # Search the text for matches
    mile = re.____(____, ____)
    
    # If a value is returned, use group(0) to return the found value
    if mile is not None:
        return float(____)
        
# Apply the function to the Length column and take a look at both columns
hiking["Length_num"] = ____.apply(____)
print(hiking[["Length", "Length_num"]].head())
Редагувати та запускати код