การแปลงข้อมูลที่โมเดลยังไม่เคยเห็น
เมื่อสร้างเวกเตอร์จากข้อความ การแปลงข้อมูลใด ๆ ที่ทำก่อนการ train โมเดล machine learning จะต้องนำไปใช้กับข้อมูล test (ที่โมเดลยังไม่เคยเห็น) ด้วยเช่นกัน วิธีการคือใช้แนวทางเดียวกับบทที่แล้ว: fit vectorizer กับข้อมูล training เท่านั้น แล้วนำไปใช้กับข้อมูล test
สำหรับแบบฝึกหัดนี้ DataFrame speech_df ถูกแบ่งออกเป็นสองส่วน:
train_speech_df: ชุดข้อมูล training ประกอบด้วยสุนทรพจน์ 45 รายการแรกtest_speech_df: ชุดข้อมูล test ประกอบด้วยสุนทรพจน์ที่เหลือ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
คำแนะนำการฝึกหัด
- สร้าง instance ของ
TfidfVectorizer - Fit vectorizer แล้วนำไปใช้กับคอลัมน์
text_clean - นำ vectorizer ตัวเดิมไปใช้กับคอลัมน์
text_cleanของข้อมูล test - สร้าง DataFrame จาก feature ใหม่เหล่านี้จากชุดข้อมูล test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Instantiate TfidfVectorizer
tv = ____(max_features=100, stop_words='english')
# Fit the vectroizer and transform the data
tv_transformed = ____
# Transform test data
test_tv_transformed = ____
# Create new features for the test set
test_tv_df = pd.DataFrame(test_tv_transformed.____,
columns=tv.____).add_prefix('TFIDF_')
print(test_tv_df.head())