เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

หลายคอลัมน์ข้อความ

ในแบบฝึกหัดนี้ จะได้ทำงานกับข้อมูล Twitter ของสายการบินต่อ โดยมีชุดข้อมูล tweets นำเข้ามาให้แล้ว

ในบางกรณี ชุดข้อมูลอาจมีคอลัมน์ข้อความมากกว่าหนึ่งคอลัมน์ และอาจต้องการสร้างการแทนค่าเชิงตัวเลขสำหรับแต่ละคอลัมน์ ที่นี่นอกจากคอลัมน์ text ซึ่งเก็บเนื้อหาของทวีตแล้ว ยังมีคอลัมน์ข้อความที่สองชื่อ negativereason ซึ่งบันทึกเหตุผลที่ลูกค้าให้รีวิวเชิงลบ

งานของคุณคือสร้าง BOW representation สำหรับทั้งสองคอลัมน์ พร้อมระบุ stop words ที่ต้องการ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าแพ็กเกจ vectorizer และรายการ stop words ภาษาอังกฤษเริ่มต้น
  • อัปเดตรายการ stop words ภาษาอังกฤษเริ่มต้น และสร้าง set ชื่อ my_stop_words
  • ระบุอาร์กิวเมนต์ stop words ใน vectorizer ตัวแรกเป็น set ที่อัปเดตแล้ว และใน vectorizer ตัวที่สอง — เป็น stop words ภาษาอังกฤษเริ่มต้น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
แก้ไขและรันโค้ด