НачатьНачать бесплатно

Пороговое значение

В этом упражнении, как и на протяжении всей главы, вы будете работать с DataFrame restaurants, который содержит данные о различных ресторанах. Ваша конечная цель — создать систему рекомендации ресторанов, однако сначала нужно привести данные в порядок.

Эта версия restaurants собрана из множества источников, и в столбце cuisine_type встречается много опечаток. Он должен содержать только значения italian, american и asian. Уникальных категорий настолько много, что переименовывать их вручную нецелесообразно — лучше воспользоваться схожестью строк.

Прежде чем приступать к этому, определите пороговое значение оценки схожести с помощью функции process.extract() из библиотеки thefuzz, найдя оценку схожести для наиболее отдалённой опечатки в каждой категории.

Это упражнение является частью курса

Очистка данных в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import process from thefuzz
____

# Store the unique values of cuisine_type in unique_types
unique_types = ____

# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))

# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))

# Calculate similarity of 'italian' to all values of unique_types
print(____)
Редактировать и запускать код