เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแปลงข้อมูลที่โมเดลยังไม่เคยเห็น

เมื่อสร้างเวกเตอร์จากข้อความ การแปลงข้อมูลใด ๆ ที่ทำก่อนการ train โมเดล machine learning จะต้องนำไปใช้กับข้อมูล test (ที่โมเดลยังไม่เคยเห็น) ด้วยเช่นกัน วิธีการคือใช้แนวทางเดียวกับบทที่แล้ว: fit vectorizer กับข้อมูล training เท่านั้น แล้วนำไปใช้กับข้อมูล test

สำหรับแบบฝึกหัดนี้ DataFrame speech_df ถูกแบ่งออกเป็นสองส่วน:

  • train_speech_df: ชุดข้อมูล training ประกอบด้วยสุนทรพจน์ 45 รายการแรก
  • test_speech_df: ชุดข้อมูล test ประกอบด้วยสุนทรพจน์ที่เหลือ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง instance ของ TfidfVectorizer
  • Fit vectorizer แล้วนำไปใช้กับคอลัมน์ text_clean
  • นำ vectorizer ตัวเดิมไปใช้กับคอลัมน์ text_clean ของข้อมูล test
  • สร้าง DataFrame จาก feature ใหม่เหล่านี้จากชุดข้อมูล test

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')

# Fit the vectroizer and transform the data
tv_transformed = ____

# Transform test data
test_tv_transformed = ____

# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____, 
                          columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())
แก้ไขและรันโค้ด