เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ขั้นตอนที่ 2: สร้าง Vectorizer

ในแบบฝึกหัดนี้ ให้สร้างการแปลง TfIDF จากคอลัมน์ review ในชุดข้อมูล reviews โดยต้องระบุ n-gram, stop words, รูปแบบของ token และขนาดของ vocabulary

นี่คือขั้นตอนสุดท้ายก่อนที่จะฝึก classifier เพื่อพยากรณ์ความรู้สึกของรีวิว

โปรดระบุจำนวน feature สูงสุดให้ถูกต้อง เนื่องจาก vocabulary ที่มีขนาดใหญ่เกินไปอาจทำให้เซสชันของคุณหลุดได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import Tfidf vectorizer และรายการ stop words ภาษาอังกฤษเริ่มต้น
  • สร้าง Tfidf vectorizer โดยระบุ argument ตามลำดับดังนี้: ใช้รายการ stop words ภาษาอังกฤษเริ่มต้น; ใช้ uni-gram และ bi-gram สำหรับ n-gram; กำหนดจำนวน feature สูงสุดเป็น 200; และดึงเฉพาะคำตามรูปแบบที่กำหนด
  • สร้าง DataFrame โดยใช้ Tfidf vectorizer

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
แก้ไขและรันโค้ด