开始使用免费开始使用

重新映射类别 II

在上一个练习中,您确定用于重新映射 cuisine_type 列中 'american''asian''italian' 菜系类型拼写错误的距离阈值应为 80。

在本练习中,您将把这些步骤整合起来:对每个正确的菜系类型,使用 fuzywuzzy.processextract() 函数,找出相似度分数大于或等于 80 的匹配项,并将其替换为正确类别。请记住,当使用 process.extract() 将一个字符串与一个字符串数组进行比较时,输出是由元组组成的列表,每个元组的格式为:

(closest match, similarity score, index of match)

restaurants DataFrame 已在您的环境中,您还可以访问包含正确菜系类型('italian''asian''american')的 categories 列表。

本练习是课程的一部分

Python 数据清洗

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Inspect the unique values of the cuisine_type column
print(____)
编辑并运行代码