การวิเคราะห์ความรู้สึกเกี่ยวกับสายการบินด้วย Stop Words
ชุดข้อมูลที่ใช้ในแบบฝึกหัดนี้มีชื่อว่า tweets ซึ่งเก็บรีวิวและความรู้สึกของลูกค้าที่มีต่อสายการบิน โดยมี 2 คอลัมน์ ได้แก่ airline_sentiment และ text โดย sentiment สามารถเป็นได้ทั้ง positive, negative หรือ neutral และ text คือข้อความของทวีต
ในแบบฝึกหัดนี้ จะสร้างการแทนค่าแบบ BOW โดยคำนึงถึง stop words ด้วย จำไว้ว่า stop words ไม่ได้ให้ข้อมูลที่มีประโยชน์ การตัดออกจะช่วยลดขนาดของ vocabulary และจำนวน feature ในที่สุด นอกจากนี้ยังสามารถเพิ่ม stop words เฉพาะที่เกี่ยวข้องกับบริบทของเราลงในรายการเริ่มต้นได้อีกด้วย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- นำเข้ารายการ stop words ภาษาอังกฤษเริ่มต้น
- อัปเดตรายการ stop words เริ่มต้นด้วยรายการ
['airline', 'airlines', '@']ที่กำหนดให้ เพื่อสร้างmy_stop_words - ระบุอาร์กิวเมนต์ stop words ใน vectorizer
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the stop words
from sklearn.feature_extraction.text import CountVectorizer, ____
# Define the stop words
my_stop_words = ____.____(['airline', 'airlines', '@'])
# Build and fit the vectorizer
vect = CountVectorizer(____=my_stop_words)
vect.fit(tweets.text)
# Create the bow representation
X_review = vect.transform(tweets.text)
# Create the data frame
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())