ทดลองกับทวีต รอบที่ 1
จำได้ไหมว่าในบทก่อนๆ ของคอร์สนี้ คุณรับบทเป็นนักวิเคราะห์ข้อมูลให้กับเอเจนซี่เว็บ? ตอนนี้งานออกมาดีมากจนได้รับโปรเจกต์ใหม่อีกแล้ว! ในบทนี้จะได้วิเคราะห์ข้อมูลประเภทใหม่คือ JSON output
ทีมวิศวกรได้ส่งผลลัพธ์จากการเก็บข้อมูลมาให้ ซึ่งประกอบด้วยทวีตที่รวบรวมระหว่างงาน RStudio Conf 2018 เนื่องจากชุดข้อมูลนี้อยู่ในรูปแบบ JSON จึงได้อ่านเข้ามาเป็น nested list ใน R แล้ว
ขั้นแรก ลองสำรวจชุดข้อมูลนี้เบื้องต้นก่อน โดยมี purrr คอยช่วยเหลือ แพ็กเกจถูกโหลดไว้ให้แล้ว และชุดข้อมูล rstudioconf พร้อมใช้งานใน workspace ของคุณ
หมายเหตุ: อย่าพิมพ์ชุดข้อมูลทั้งหมด เพราะมีขนาดใหญ่เกินกว่าจะแสดงใน console ของ DataCamp
โปรดทราบว่านี่คือข้อมูลจริงจาก Twitter ดังนั้นอาจมีความเสี่ยงที่จะพบคำหยาบหรือเนื้อหาที่ไม่เหมาะสม (ทั้งในแบบฝึกหัดนี้และแบบฝึกหัดถัดไปที่ใช้ข้อมูล Twitter จริง)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Functional Programming ระดับกลางด้วย purrr
คำแนะนำการฝึกหัด
พิมพ์ element แรกของ list เพื่อดูภาพรวมของเนื้อหาและโครงสร้าง
เนื่องจากต้องการโฟกัสเฉพาะทวีตต้นฉบับ (ไม่ใช่ retweet) ให้สร้าง sublist ของทวีตที่ไม่ใช่ retweet โดยใช้ element ที่เป็น logical ชื่อ
"is_retweet"ที่อยู่ใน sublist แต่ละรายการดึง element
"favorite_count"จากแต่ละ element ใน sublist ใหม่นี้ โดยใช้ตัวแปรmap_*สำหรับจำนวนเต็มคำนวณค่ามัธยฐานจากผลลัพธ์ที่ได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)