Пороговое значение
В этом упражнении, как и на протяжении всей главы, вы будете работать с DataFrame restaurants, который содержит данные о различных ресторанах. Ваша конечная цель — создать систему рекомендации ресторанов, однако сначала нужно привести данные в порядок.
Эта версия restaurants собрана из множества источников, и в столбце cuisine_type встречается много опечаток. Он должен содержать только значения italian, american и asian. Уникальных категорий настолько много, что переименовывать их вручную нецелесообразно — лучше воспользоваться схожестью строк.
Прежде чем приступать к этому, определите пороговое значение оценки схожести с помощью функции process.extract() из библиотеки thefuzz, найдя оценку схожести для наиболее отдалённой опечатки в каждой категории.
Это упражнение является частью курса
Очистка данных в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import process from thefuzz
____
# Store the unique values of cuisine_type in unique_types
unique_types = ____
# Calculate similarity of 'asian' to all values of unique_types
print(process.____('____', ____, limit = len(____)))
# Calculate similarity of 'american' to all values of unique_types
print(____('____', ____, ____))
# Calculate similarity of 'italian' to all values of unique_types
print(____)