เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สำรวจโครงสร้างของ tibbles

เมื่อลองพิมพ์ tibble ที่อ้างอิงข้อมูลซึ่งจัดเก็บอยู่ใน Spark จะมีกระบวนการพิเศษเกิดขึ้นเบื้องหลัง เพราะ tibble ไม่ได้เก็บสำเนาข้อมูลไว้ในตัวเอง กระบวนการดังกล่าวคือ เมธอด print จะใช้การเชื่อมต่อ Spark ของคุณเพื่อดึงข้อมูลบางส่วนกลับมายัง R แล้วแสดงผลราวกับว่าข้อมูลถูกจัดเก็บไว้ในเครื่อง อย่างที่เห็นในบทก่อนหน้า การคัดลอกข้อมูลเป็นการดำเนินการที่ ช้า ดังนั้นโดยค่าเริ่มต้น จึงแสดงผลเพียง 10 แถวและจำนวนคอลัมน์เท่าที่พอดีกับหน้าจอ

สามารถเปลี่ยนจำนวนแถวที่แสดงได้โดยใช้อาร์กิวเมนต์ n ใน print() และเปลี่ยนความกว้างของเนื้อหาที่แสดงได้ด้วยอาร์กิวเมนต์ width ซึ่งระบุเป็นจำนวนอักขระ (ไม่ใช่จำนวนคอลัมน์) เทคนิคที่ดีคือใช้ width = Inf เพื่อแสดงทุกคอลัมน์

ฟังก์ชัน str() มักใช้เพื่อแสดงโครงสร้างของตัวแปร สำหรับ data.frame จะให้ข้อมูลสรุปที่ครอบคลุม ทั้งชนิดข้อมูลและค่าแรกของแต่ละคอลัมน์ อย่างไรก็ตาม สำหรับ tibble ที่มีแหล่งข้อมูลระยะไกล str() ไม่สามารถดึงข้อมูลได้ ซึ่งหมายความว่าหากเรียก str() กับ tibble ที่จัดเก็บข้อมูลใน Spark จะเห็นรายการที่ประกอบด้วย Spark connection object และส่วนประกอบอื่น ๆ อีกเล็กน้อย

หากต้องการดูสรุปเนื้อหาของแต่ละคอลัมน์ในชุดข้อมูลที่ tibble อ้างอิงถึง ให้เรียก glimpse() แทน โปรดทราบว่าสำหรับข้อมูลระยะไกล เช่น ข้อมูลที่จัดเก็บใน Spark จำนวนแถวที่แสดงอาจไม่ถูกต้อง ในกรณีนี้ glimpse() จะรายงานจำนวนแถวได้ไม่แม่นยำ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

มีการสร้าง Spark connection ไว้ให้แล้วในชื่อ spark_conn และกำหนด tibble ที่เชื่อมโยงกับ track metadata ที่จัดเก็บใน Spark ไว้ล่วงหน้าในชื่อ track_metadata_tbl

  • แสดง 5 แถวแรกและทุกคอลัมน์ของ track metadata
  • ตรวจสอบโครงสร้างของ tibble โดยใช้ str()
  • ตรวจสอบโครงสร้างของ track metadata โดยใช้ glimpse()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print 5 rows, all columns
___

# Examine structure of tibble
___

# Examine structure of data
___
แก้ไขและรันโค้ด