เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การเลือกคอลัมน์

วิธีที่ง่ายที่สุดในการจัดการ data frame ที่เก็บอยู่ใน Spark คือการใช้ syntax ของ dplyr หากต้องการเรียนรู้เรื่องนี้อย่างละเอียด สามารถดูได้ในคอร์ส Data Manipulation with dplyr และ Joining Data with dplyr แต่ในบทถัดไปเราจะครอบคลุมประเด็นสำคัญทั้งหมดด้วยกัน

dplyr มี 5 การดำเนินการหลักที่ใช้กับ data frame ได้แก่ การเลือกคอลัมน์ การกรองแถว การเรียงลำดับแถว การแก้ไขหรือเพิ่มคอลัมน์ และการคำนวณสถิติสรุป

เริ่มต้นด้วยการเลือกคอลัมน์กันก่อน โดยเรียกใช้ select() พร้อมระบุ tibble และชื่อคอลัมน์ที่ต้องการโดยไม่ต้องใส่เครื่องหมายคำพูด ฟังก์ชันของ dplyr มักใช้ร่วมกับ pipe operator ของ magrittr คือ %>% ตัวอย่างเช่น หากต้องการเลือกคอลัมน์ x, y, และ z ให้เขียนดังนี้

a_tibble %>%
  select(x, y, z)

ข้อควรทราบ: sparklyr ยังไม่รองรับการ index ด้วยวงเล็บเหลี่ยมในปัจจุบัน ดังนั้นจึงไม่สามารถเขียนแบบนี้ได้

a_tibble[, c("x", "y", "z")]

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

มีการสร้าง Spark connection ไว้ให้แล้วในชื่อ spark_conn และกำหนด tibble ที่เชื่อมต่อกับ track metadata ที่เก็บใน Spark ไว้ล่วงหน้าในชื่อ track_metadata_tbl

  • เลือกคอลัมน์ artist_name, release, title, และ year โดยใช้ select()
  • ลองทำแบบเดิมโดยใช้การ index ด้วยวงเล็บเหลี่ยม — แต่คาดว่าจะเกิด error ดังนั้นโค้ดส่วนนี้จึงถูกครอบไว้ด้วย tryCatch()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
แก้ไขและรันโค้ด