การเลือกคอลัมน์
วิธีที่ง่ายที่สุดในการจัดการ data frame ที่เก็บอยู่ใน Spark คือการใช้ syntax ของ dplyr หากต้องการเรียนรู้เรื่องนี้อย่างละเอียด สามารถดูได้ในคอร์ส Data Manipulation with dplyr และ Joining Data with dplyr แต่ในบทถัดไปเราจะครอบคลุมประเด็นสำคัญทั้งหมดด้วยกัน
dplyr มี 5 การดำเนินการหลักที่ใช้กับ data frame ได้แก่ การเลือกคอลัมน์ การกรองแถว การเรียงลำดับแถว การแก้ไขหรือเพิ่มคอลัมน์ และการคำนวณสถิติสรุป
เริ่มต้นด้วยการเลือกคอลัมน์กันก่อน โดยเรียกใช้ select() พร้อมระบุ tibble และชื่อคอลัมน์ที่ต้องการโดยไม่ต้องใส่เครื่องหมายคำพูด ฟังก์ชันของ dplyr มักใช้ร่วมกับ pipe operator ของ magrittr คือ %>% ตัวอย่างเช่น หากต้องการเลือกคอลัมน์ x, y, และ z ให้เขียนดังนี้
a_tibble %>%
select(x, y, z)
ข้อควรทราบ: sparklyr ยังไม่รองรับการ index ด้วยวงเล็บเหลี่ยมในปัจจุบัน ดังนั้นจึงไม่สามารถเขียนแบบนี้ได้
a_tibble[, c("x", "y", "z")]
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
มีการสร้าง Spark connection ไว้ให้แล้วในชื่อ spark_conn และกำหนด tibble ที่เชื่อมต่อกับ track metadata ที่เก็บใน Spark ไว้ล่วงหน้าในชื่อ track_metadata_tbl
- เลือกคอลัมน์
artist_name,release,title, และyearโดยใช้select() - ลองทำแบบเดิมโดยใช้การ index ด้วยวงเล็บเหลี่ยม — แต่คาดว่าจะเกิด error ดังนั้นโค้ดส่วนนี้จึงถูกครอบไว้ด้วย
tryCatch()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)