เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ทดลองกับทวีต รอบที่ 1

จำได้ไหมว่าในบทก่อนๆ ของคอร์สนี้ คุณรับบทเป็นนักวิเคราะห์ข้อมูลให้กับเอเจนซี่เว็บ? ตอนนี้งานออกมาดีมากจนได้รับโปรเจกต์ใหม่อีกแล้ว! ในบทนี้จะได้วิเคราะห์ข้อมูลประเภทใหม่คือ JSON output

ทีมวิศวกรได้ส่งผลลัพธ์จากการเก็บข้อมูลมาให้ ซึ่งประกอบด้วยทวีตที่รวบรวมระหว่างงาน RStudio Conf 2018 เนื่องจากชุดข้อมูลนี้อยู่ในรูปแบบ JSON จึงได้อ่านเข้ามาเป็น nested list ใน R แล้ว

ขั้นแรก ลองสำรวจชุดข้อมูลนี้เบื้องต้นก่อน โดยมี purrr คอยช่วยเหลือ แพ็กเกจถูกโหลดไว้ให้แล้ว และชุดข้อมูล rstudioconf พร้อมใช้งานใน workspace ของคุณ

หมายเหตุ: อย่าพิมพ์ชุดข้อมูลทั้งหมด เพราะมีขนาดใหญ่เกินกว่าจะแสดงใน console ของ DataCamp

โปรดทราบว่านี่คือข้อมูลจริงจาก Twitter ดังนั้นอาจมีความเสี่ยงที่จะพบคำหยาบหรือเนื้อหาที่ไม่เหมาะสม (ทั้งในแบบฝึกหัดนี้และแบบฝึกหัดถัดไปที่ใช้ข้อมูล Twitter จริง)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Functional Programming ระดับกลางด้วย purrr

ดูคอร์ส

คำแนะนำการฝึกหัด

  • พิมพ์ element แรกของ list เพื่อดูภาพรวมของเนื้อหาและโครงสร้าง

  • เนื่องจากต้องการโฟกัสเฉพาะทวีตต้นฉบับ (ไม่ใช่ retweet) ให้สร้าง sublist ของทวีตที่ไม่ใช่ retweet โดยใช้ element ที่เป็น logical ชื่อ "is_retweet" ที่อยู่ใน sublist แต่ละรายการ

  • ดึง element "favorite_count" จากแต่ละ element ใน sublist ใหม่นี้ โดยใช้ตัวแปร map_* สำหรับจำนวนเต็ม

  • คำนวณค่ามัธยฐานจากผลลัพธ์ที่ได้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print the first element of the list to the console 


# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")

# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")

# Get the median of favorite_count for non_rt
___(___)
แก้ไขและรันโค้ด