เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเลือกแถวที่ไม่ซ้ำกัน

หากมีตัวแปรเชิงหมวดหมู่ที่เก็บอยู่ในรูปแบบ factor มักจะเป็นประโยชน์ที่จะรู้ว่าแต่ละหมวดหมู่มีค่าอะไรบ้าง ซึ่งทำได้ด้วยฟังก์ชัน levels() สำหรับ tibble แนวคิดที่กว้างกว่านั้นคือการค้นหาแถวที่มีข้อมูลไม่ซ้ำกัน ตามแนวทางของ SQL จะใช้ฟังก์ชัน distinct() สามารถใช้ฟังก์ชันนี้โดยตรงกับชุดข้อมูลเพื่อหาค่าผสมที่ไม่ซ้ำกันของคอลัมน์ที่กำหนด ตัวอย่างเช่น หากต้องการหาค่าผสมที่ไม่ซ้ำกันของคอลัมน์ x, y และ z ให้เขียนดังนี้

a_tibble %>%
  distinct(x, y, z)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

มีการสร้าง Spark connection ไว้ให้แล้วในชื่อ spark_conn และ tibble ที่เชื่อมต่อกับเมทาดาต้าของแทร็กที่เก็บอยู่ใน Spark ได้ถูกกำหนดไว้ล่วงหน้าในชื่อ track_metadata_tbl

  • ค้นหาค่าที่ไม่ซ้ำกันของคอลัมน์ artist_name จาก track_metadata_tbl

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
แก้ไขและรันโค้ด