ค้นหาคีย์เวิร์ด
การนับคีย์เวิร์ดที่รู้จักเป็นหนึ่งในวิธีแรกๆ ที่ใช้วิเคราะห์ข้อมูลข้อความในชุดข้อมูล Twitter ในแบบฝึกหัดนี้ เราจะนับจำนวนครั้งที่แฮชแท็กเฉพาะเจาะจงปรากฏในคอลเล็กชันของทวีตที่เกี่ยวกับ data science โดยจะใช้เมธอดสตริงใน pandas Series เพื่อทำสิ่งนี้
pandas และ numpy ถูกนำเข้ามาแล้วในชื่อ pd และ np ตามลำดับ นอกจากนี้ flatten_tweets และ data_science_json เวอร์ชันที่สมบูรณ์ยิ่งขึ้นก็ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อมูลโซเชียลมีเดียด้วย Python
คำแนะนำการฝึกหัด
- แฟลตเทนทวีตด้วย
flatten_tweets()แล้วเก็บผลลัพธ์ไว้ในflat_tweets - แปลงทวีตเป็น DataFrame โดยใช้ตัวสร้าง DataFrame ของ pandas
- ค้นหาการกล่าวถึง
#pythonในคอลัมน์'text'โดยไม่คำนึงถึงตัวพิมพ์เล็กหรือใหญ่ - แสดงสัดส่วนของทวีตที่กล่าวถึง
#pythonโดยรวมpythonด้วยnp.sum()แล้วหารด้วยจำนวนทวีตทั้งหมด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)