開始使用免費開始

重新對應類別 II

在上一個練習中,你判定要重新對應 cuisine_type 欄位中將 'american''asian''italian' 的拼寫錯誤時,距離的臨界值應為 80。

在這個練習中,你要把整個流程串起來:對每個正確的料理類型,使用 fuzywuzzy.processextract() 函式找出相似度分數大於等於 80 的配對,並將這些配對替換為正確值。記住,當你用 process.extract() 將一個字串與一個字串陣列比較時,輸出會是由多個 tuple 組成的清單,每個 tuple 的格式如下:

(最接近的配對,相似度分數,配對的索引)

環境中已提供 restaurants DataFrame,另外也有一個包含正確料理類型('italian''asian''american')的 categories 清單可供使用。

本練習屬於課程

用 Python 進行資料清理

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Inspect the unique values of the cuisine_type column
print(____)
編輯並執行程式碼