การวิเคราะห์ความถี่ของรีวิวสินค้า
ตอนนี้คุณมีชุดข้อมูลรีวิวสินค้า TechZone ขนาดใหญ่ขึ้นแล้ว เช่นเดียวกับก่อนหน้านี้ ข้อมูลรีวิวได้ผ่านการประมวลผลและแปลงเป็น BoW representation ชื่อ X แล้ว ภารกิจของคุณคือวิเคราะห์ความถี่ของคำและระบุคำที่พบบ่อยที่สุดในชุดข้อมูล
เพื่อช่วยในการวิเคราะห์ มีฟังก์ชันช่วยชื่อ get_top_ten() ให้ใช้งาน ฟังก์ชันนี้รับรายการคำและจำนวนนับที่สอดคล้องกัน แล้วคืนค่าคำที่มีความถี่สูงสุด 10 อันดับแรกพร้อมจำนวนนับ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def preprocess(text):
text = text.lower()
tokens = word_tokenize(text)
tokens = [word for word in tokens if word not in string.punctuation]
return " ".join(tokens)
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)
# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____
top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)