เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Stem รีวิวภาษาสเปน

จำได้ไหมว่าในบทก่อนหน้า เราใช้แพ็กเกจตรวจจับภาษาเพื่อระบุภาษาของรีวิวสินค้า Amazon ต่าง ๆ ในแบบฝึกหัดนี้ จะเริ่มด้วยการตรวจจับภาษาใน non_english_reviews ซึ่งมีรีวิวหลายภาษา แต่จะเลือกเฉพาะรีวิวที่เป็นภาษาสเปนเท่านั้น หากลืมแนวคิดบางอย่าง สามารถกลับไปดูวิดีโอที่พูดถึงการตรวจจับภาษาต่างประเทศได้

ในขั้นตอนที่สอง จะสร้าง word token จากรีวิวภาษาสเปน แล้ว stem โดยใช้ SnowBall stemmer สำหรับภาษาสเปน ทั้งนี้ แพ็กเกจตรวจจับภาษาอาจไม่แม่นยำ 100% จึงเป็นไปได้ที่ภาษาที่ตรวจจับได้อาจไม่ถูกต้องเสมอไป

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
แก้ไขและรันโค้ด