or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
เรียนรู้วิธีคำนวณ feature พื้นฐาน เช่น จำนวนคำ จำนวนตัวอักษร ความยาวเฉลี่ยของคำ และจำนวนอักขระพิเศษ (เช่น แฮชแท็กและการกล่าวถึงใน Twitter) นอกจากนี้ยังจะได้เรียนรู้วิธีคำนวณคะแนนความอ่านง่าย เพื่อประเมินระดับการศึกษาที่จำเป็นสำหรับการทำความเข้าใจข้อความแต่ละชิ้น
ในบทนี้จะได้เรียนรู้เรื่อง tokenization และ lemmatization จากนั้นจะได้เรียนรู้วิธีทำความสะอาดข้อความ, part-of-speech tagging และ named entity recognition โดยใช้ไลบรารี spaCy เมื่อเข้าใจแนวคิดเหล่านี้แล้ว จะได้ฝึกแปลงสุนทรพจน์ Gettysburg ให้เครื่องอ่านได้, วิเคราะห์การใช้คำนามในข่าวปลอม และระบุบุคคลที่ถูกกล่าวถึงในบทความจาก TechCrunch
เรียนรู้เรื่อง n-gram modeling และนำไปใช้วิเคราะห์ความรู้สึก (sentiment analysis) จากรีวิวภาพยนตร์
เรียนรู้วิธีคำนวณค่าน้ำหนัก tf-idf และคะแนน cosine similarity ระหว่างเวกเตอร์สองตัว จากนั้นจะได้นำแนวคิดเหล่านี้ไปสร้างระบบแนะนำภาพยนตร์และ TED Talk และยังจะได้เรียนรู้เรื่อง word embeddings รวมถึงการใช้การแทนค่าด้วย word vector เพื่อคำนวณความคล้ายคลึงระหว่างเพลงของ Pink Floyd
แบบฝึกหัดปัจจุบัน