เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทำความสะอาดข้อความ

ข้อมูลข้อความที่ไม่มีโครงสร้างไม่สามารถนำไปใช้ในการวิเคราะห์ส่วนใหญ่ได้โดยตรง จำเป็นต้องผ่านหลายขั้นตอนเพื่อแปลงข้อความอิสระที่ยาวให้กลายเป็นชุดคอลัมน์ตัวเลขในรูปแบบที่เหมาะสมสำหรับโมเดล machine learning ขั้นตอนแรกคือการทำให้ข้อมูลเป็นมาตรฐานและกำจัดอักขระที่อาจก่อให้เกิดปัญหาในขั้นตอนต่อไปของ pipeline การวิเคราะห์

ในบทนี้จะได้ทำงานกับชุดข้อมูลใหม่ที่เก็บสุนทรพจน์เปิดตัวของประธานาธิบดีสหรัฐอเมริกา โดยโหลดไว้ในชื่อ speech_df และเก็บข้อความสุนทรพจน์ไว้ในคอลัมน์ text

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print the first 5 rows of the text column
print(____)
แก้ไขและรันโค้ด