สำรวจโครงสร้างของ tibbles
เมื่อลองพิมพ์ tibble ที่อ้างอิงข้อมูลซึ่งจัดเก็บอยู่ใน Spark จะมีกระบวนการพิเศษเกิดขึ้นเบื้องหลัง เพราะ tibble ไม่ได้เก็บสำเนาข้อมูลไว้ในตัวเอง กระบวนการดังกล่าวคือ เมธอด print จะใช้การเชื่อมต่อ Spark ของคุณเพื่อดึงข้อมูลบางส่วนกลับมายัง R แล้วแสดงผลราวกับว่าข้อมูลถูกจัดเก็บไว้ในเครื่อง อย่างที่เห็นในบทก่อนหน้า การคัดลอกข้อมูลเป็นการดำเนินการที่ ช้า ดังนั้นโดยค่าเริ่มต้น จึงแสดงผลเพียง 10 แถวและจำนวนคอลัมน์เท่าที่พอดีกับหน้าจอ
สามารถเปลี่ยนจำนวนแถวที่แสดงได้โดยใช้อาร์กิวเมนต์ n ใน print() และเปลี่ยนความกว้างของเนื้อหาที่แสดงได้ด้วยอาร์กิวเมนต์ width ซึ่งระบุเป็นจำนวนอักขระ (ไม่ใช่จำนวนคอลัมน์) เทคนิคที่ดีคือใช้ width = Inf เพื่อแสดงทุกคอลัมน์
ฟังก์ชัน str() มักใช้เพื่อแสดงโครงสร้างของตัวแปร สำหรับ data.frame จะให้ข้อมูลสรุปที่ครอบคลุม ทั้งชนิดข้อมูลและค่าแรกของแต่ละคอลัมน์ อย่างไรก็ตาม สำหรับ tibble ที่มีแหล่งข้อมูลระยะไกล str() ไม่สามารถดึงข้อมูลได้ ซึ่งหมายความว่าหากเรียก str() กับ tibble ที่จัดเก็บข้อมูลใน Spark จะเห็นรายการที่ประกอบด้วย Spark connection object และส่วนประกอบอื่น ๆ อีกเล็กน้อย
หากต้องการดูสรุปเนื้อหาของแต่ละคอลัมน์ในชุดข้อมูลที่ tibble อ้างอิงถึง ให้เรียก glimpse() แทน โปรดทราบว่าสำหรับข้อมูลระยะไกล เช่น ข้อมูลที่จัดเก็บใน Spark จำนวนแถวที่แสดงอาจไม่ถูกต้อง ในกรณีนี้ glimpse() จะรายงานจำนวนแถวได้ไม่แม่นยำ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
มีการสร้าง Spark connection ไว้ให้แล้วในชื่อ spark_conn และกำหนด tibble ที่เชื่อมโยงกับ track metadata ที่จัดเก็บใน Spark ไว้ล่วงหน้าในชื่อ track_metadata_tbl
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print 5 rows, all columns
___
# Examine structure of tibble
___
# Examine structure of data
___