ขั้นตอนที่ 2: สร้าง Vectorizer
ในแบบฝึกหัดนี้ ให้สร้างการแปลง TfIDF จากคอลัมน์ review ในชุดข้อมูล reviews โดยต้องระบุ n-gram, stop words, รูปแบบของ token และขนาดของ vocabulary
นี่คือขั้นตอนสุดท้ายก่อนที่จะฝึก classifier เพื่อพยากรณ์ความรู้สึกของรีวิว
โปรดระบุจำนวน feature สูงสุดให้ถูกต้อง เนื่องจาก vocabulary ที่มีขนาดใหญ่เกินไปอาจทำให้เซสชันของคุณหลุดได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- Import Tfidf vectorizer และรายการ stop words ภาษาอังกฤษเริ่มต้น
- สร้าง Tfidf vectorizer โดยระบุ argument ตามลำดับดังนี้: ใช้รายการ stop words ภาษาอังกฤษเริ่มต้น; ใช้ uni-gram และ bi-gram สำหรับ n-gram; กำหนดจำนวน feature สูงสุดเป็น 200; และดึงเฉพาะคำตามรูปแบบที่กำหนด
- สร้าง DataFrame โดยใช้ Tfidf vectorizer
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____
# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)
# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())