เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ผลกระทบของสเกล

ที่ผ่านมาได้เรียนรู้ว่าหากตัวแปรหนึ่งมีสเกลใหญ่กว่าตัวแปรอื่นในชุดข้อมูล ตัวแปรนั้นอาจส่งผลต่อค่าระยะทางที่คำนวณได้อย่างไม่สมดุล ลองดูตัวอย่างจริงโดยสำรวจข้อมูลตัวอย่างจากชุดข้อมูล trees

จะใช้ฟังก์ชัน scale() ซึ่งโดยค่าเริ่มต้นจะทำการ center และปรับสเกลให้กับฟีเจอร์แต่ละคอลัมน์

ตัวแปรในชุดข้อมูลนี้มีดังนี้:

  • Girth - เส้นผ่านศูนย์กลางของต้นไม้ (หน่วยเป็นนิ้ว)
  • Height - ความสูงของต้นไม้ (หน่วยเป็นนิ้ว)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์กลุ่มข้อมูลใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • คำนวณ distance matrix สำหรับ data frame three_trees และเก็บผลลัพธ์ไว้ในตัวแปร dist_trees
  • สร้างตัวแปรใหม่ชื่อ scaled_three_trees โดยนำข้อมูลจาก three_trees มาผ่านการ center และปรับสเกล
  • คำนวณและแสดง distance matrix สำหรับ scaled_three_trees แล้วเก็บผลลัพธ์ไว้ในตัวแปร dist_scaled_trees
  • แสดงผลทั้ง dist_trees และ dist_scaled_trees จากนั้นสังเกตว่าคู่ข้อมูลที่มีระยะทางน้อยที่สุดเปลี่ยนไปอย่างไรระหว่างทั้งสอง matrix (คำใบ้: ค่าที่ได้เปลี่ยนไปแล้ว)

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
แก้ไขและรันโค้ด