ผลกระทบของสเกล
ที่ผ่านมาได้เรียนรู้ว่าหากตัวแปรหนึ่งมีสเกลใหญ่กว่าตัวแปรอื่นในชุดข้อมูล ตัวแปรนั้นอาจส่งผลต่อค่าระยะทางที่คำนวณได้อย่างไม่สมดุล ลองดูตัวอย่างจริงโดยสำรวจข้อมูลตัวอย่างจากชุดข้อมูล trees
จะใช้ฟังก์ชัน scale() ซึ่งโดยค่าเริ่มต้นจะทำการ center และปรับสเกลให้กับฟีเจอร์แต่ละคอลัมน์
ตัวแปรในชุดข้อมูลนี้มีดังนี้:
- Girth - เส้นผ่านศูนย์กลางของต้นไม้ (หน่วยเป็นนิ้ว)
- Height - ความสูงของต้นไม้ (หน่วยเป็นนิ้ว)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์กลุ่มข้อมูลใน R
คำแนะนำการฝึกหัด
- คำนวณ distance matrix สำหรับ data frame
three_treesและเก็บผลลัพธ์ไว้ในตัวแปรdist_trees - สร้างตัวแปรใหม่ชื่อ
scaled_three_treesโดยนำข้อมูลจากthree_treesมาผ่านการ center และปรับสเกล - คำนวณและแสดง distance matrix สำหรับ
scaled_three_treesแล้วเก็บผลลัพธ์ไว้ในตัวแปรdist_scaled_trees - แสดงผลทั้ง
dist_treesและdist_scaled_treesจากนั้นสังเกตว่าคู่ข้อมูลที่มีระยะทางน้อยที่สุดเปลี่ยนไปอย่างไรระหว่างทั้งสอง matrix (คำใบ้: ค่าที่ได้เปลี่ยนไปแล้ว)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___