開始使用免費開始

商品評論的語言偵測

你將在名為 non_english_reviews 的小型資料集上練習語言偵測。這是來自 Amazon 商品評論的非英語評論樣本。

你會逐列走訪資料集,偵測每一列的語言,並把結果加入一個空清單。需要清理這個清單,讓它只保留評論的語言代碼,例如英文用 'en',而不是原始輸出 en:0.9987654。請記得語言偵測函式可能會偵測到不只一種語言,而回傳清單中的第一個項目是最可能的候選。最後,將這個清單指定到新的欄位。

邏輯與投影片與前一個練習相同,但這次不是把函式套用到一個清單,而是操作整個資料集。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 逐列走訪 non_english_reviews 資料集。
  • 在迴圈內,偵測資料集第 2 欄的語言。
  • 在列表生成式中,使用以 : 分割的方式清理字串。
  • 最後,把清理後的清單指定到新的欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
編輯並執行程式碼