or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ข้อมูลดิบไม่ได้อยู่ในรูปแบบที่เหมาะสมสำหรับการวิเคราะห์เสมอไป ในบทเปิดนี้ คุณจะได้รู้จักกับวิธีการแปลงและสร้างฟีเจอร์ที่ช่วยเพิ่มประสิทธิภาพและความสามารถในการตีความผลของโมเดล
ในบทนี้ คุณจะได้เรียนรู้ว่า นอกจากการแปลงฟีเจอร์ด้วยตนเองแล้ว ยังสามารถใช้เครื่องมือจาก tidyverse เพื่อสร้างตัวแปรใหม่แบบอัตโนมัติได้อีกด้วย จะได้สำรวจว่าแนวทางนี้ช่วยเพิ่มความสามารถในการทำซ้ำของโมเดล และมีประโยชน์อย่างยิ่งเมื่อต้องจัดการกับชุดข้อมูลที่มีฟีเจอร์จำนวนมาก
คุณจะได้เรียนรู้ว่าโมเดลมักได้ประโยชน์จากการลดมิติข้อมูลและการแยกฟีเจอร์จากข้อมูลที่มีมิติสูง ซึ่งรวมถึงการแปลงข้อมูลข้อความเป็นตัวเลข การ encoding ข้อมูลเชิงกลุ่ม และการจัดอันดับความสามารถในการพยากรณ์ของตัวแปร จะได้สำรวจวิธีการต่าง ๆ เช่น principal component analysis, kernel principal component analysis, การแยกค่าตัวเลขจากข้อความ, categorical encodings และคะแนนความสำคัญของตัวแปร
คุณจะสรุปบทเรียนด้วยการเรียนรู้เทคนิค feature engineering และ machine learning โดยเริ่มจากการทำความเข้าใจปัญหาที่เกิดจากการใช้ฟีเจอร์ทั้งหมดที่มีในโมเดล รวมถึงความสำคัญของการระบุฟีเจอร์ที่ไม่เกี่ยวข้องและซ้ำซ้อน และการเรียนรู้วิธีตัดฟีเจอร์เหล่านั้นออกโดยใช้ embedded methods เช่น lasso และ elastic-net จากนั้นจะสำรวจ shrinkage methods เช่น lasso, ridge และ elastic-net ซึ่งใช้สำหรับ regularize น้ำหนักของฟีเจอร์หรือเลือกฟีเจอร์โดยการตั้งค่าสัมประสิทธิ์เป็นศูนย์ สุดท้าย จะจบลงด้วยการสร้าง workflow ของ feature engineering แบบครบวงจร พร้อมทบทวนและฝึกฝนแนวคิดและฟังก์ชันที่เรียนรู้มาในโปรเจกต์ขนาดเล็ก
แบบฝึกหัดปัจจุบัน