Bắt đầu ngayBắt đầu miễn phí

Phát hiện ngôn ngữ của đánh giá sản phẩm

Bạn sẽ thực hành phát hiện ngôn ngữ trên một tập dữ liệu nhỏ tên là non_english_reviews. Đây là mẫu các đánh giá không phải tiếng Anh lấy từ đánh giá sản phẩm Amazon.

Bạn sẽ lặp qua từng hàng của tập dữ liệu, phát hiện ngôn ngữ của mỗi hàng và thêm vào một danh sách trống. Cần làm sạch danh sách để nó chỉ chứa mã ngôn ngữ của đánh giá như 'en' cho tiếng Anh, thay vì đầu ra thông thường en:0.9987654. Lưu ý rằng hàm phát hiện ngôn ngữ có thể phát hiện hơn một ngôn ngữ và phần tử đầu tiên trong danh sách trả về là ứng viên có khả năng cao nhất. Cuối cùng, bạn sẽ gán danh sách này cho một cột mới.

Logic giống như trong các slide và bài tập trước, nhưng thay vì áp dụng hàm cho một danh sách, bạn sẽ làm việc với một tập dữ liệu.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Lặp qua các hàng của tập dữ liệu non_english_reviews.
  • Bên trong vòng lặp, phát hiện ngôn ngữ của cột thứ hai trong tập dữ liệu.
  • Làm sạch chuỗi bằng cách tách theo ký tự : ngay trong biểu thức list comprehension.
  • Cuối cùng, gán danh sách đã làm sạch vào một cột mới.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Chỉnh sửa và Chạy Mã