หลายคอลัมน์ข้อความ
ในแบบฝึกหัดนี้ จะได้ทำงานกับข้อมูล Twitter ของสายการบินต่อ โดยมีชุดข้อมูล tweets นำเข้ามาให้แล้ว
ในบางกรณี ชุดข้อมูลอาจมีคอลัมน์ข้อความมากกว่าหนึ่งคอลัมน์ และอาจต้องการสร้างการแทนค่าเชิงตัวเลขสำหรับแต่ละคอลัมน์ ที่นี่นอกจากคอลัมน์ text ซึ่งเก็บเนื้อหาของทวีตแล้ว ยังมีคอลัมน์ข้อความที่สองชื่อ negativereason ซึ่งบันทึกเหตุผลที่ลูกค้าให้รีวิวเชิงลบ
งานของคุณคือสร้าง BOW representation สำหรับทั้งสองคอลัมน์ พร้อมระบุ stop words ที่ต้องการ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- นำเข้าแพ็กเกจ vectorizer และรายการ stop words ภาษาอังกฤษเริ่มต้น
- อัปเดตรายการ stop words ภาษาอังกฤษเริ่มต้น และสร้าง set ชื่อ
my_stop_words - ระบุอาร์กิวเมนต์ stop words ใน vectorizer ตัวแรกเป็น set ที่อัปเดตแล้ว และใน vectorizer ตัวที่สอง — เป็น stop words ภาษาอังกฤษเริ่มต้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the vectorizer and default English stop words list
____
# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____)
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)
# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())