การ Stem รีวิวภาษาสเปน
จำได้ไหมว่าในบทก่อนหน้า เราใช้แพ็กเกจตรวจจับภาษาเพื่อระบุภาษาของรีวิวสินค้า Amazon ต่าง ๆ ในแบบฝึกหัดนี้ จะเริ่มด้วยการตรวจจับภาษาใน non_english_reviews ซึ่งมีรีวิวหลายภาษา แต่จะเลือกเฉพาะรีวิวที่เป็นภาษาสเปนเท่านั้น หากลืมแนวคิดบางอย่าง สามารถกลับไปดูวิดีโอที่พูดถึงการตรวจจับภาษาต่างประเทศได้
ในขั้นตอนที่สอง จะสร้าง word token จากรีวิวภาษาสเปน แล้ว stem โดยใช้ SnowBall stemmer สำหรับภาษาสเปน ทั้งนี้ แพ็กเกจตรวจจับภาษาอาจไม่แม่นยำ 100% จึงเป็นไปได้ที่ภาษาที่ตรวจจับได้อาจไม่ถูกต้องเสมอไป
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']