商品評論的語言偵測
你將在名為 non_english_reviews 的小型資料集上練習語言偵測。這是來自 Amazon 商品評論的非英語評論樣本。
你會逐列走訪資料集,偵測每一列的語言,並把結果加入一個空清單。需要清理這個清單,讓它只保留評論的語言代碼,例如英文用 'en',而不是原始輸出 en:0.9987654。請記得語言偵測函式可能會偵測到不只一種語言,而回傳清單中的第一個項目是最可能的候選。最後,將這個清單指定到新的欄位。
邏輯與投影片與前一個練習相同,但這次不是把函式套用到一個清單,而是操作整個資料集。
本練習屬於課程
Python 情感分析
練習說明
- 逐列走訪
non_english_reviews資料集。 - 在迴圈內,偵測資料集第 2 欄的語言。
- 在列表生成式中,使用以
:分割的方式清理字串。 - 最後,把清理後的清單指定到新的欄位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())