並非所有正或負的斜率都一定是真實效果。p 值用來評估觀察到的趨勢是否可能只是隨機造成。一般來說,資料科學家會設定一個門檻,例如 p 值低於 .05 就視為具有統計顯著性。
US_fit 仍在你的工作區中。在這個線性模型裡,year 與 percent_yes 之間關係的 p 值是多少?
US_fit
year
percent_yes
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
學習資料整備技能的最佳方式,就是把它們套用在具體案例上。你將學會使用 dplyr 套件清理與篩選聯合國投票資料集,並將其彙整成更小且可解讀的單位。
當你完成資料清理與彙整後,接著就需要把資料視覺化,以理解趨勢並擷取洞見。在這裡,你會使用 ggplot2 套件來探索各國隨時間變化的聯合國投票趨勢。
視覺化有助於一次理解一個國家;統計建模則能量化多個國家的整體趨勢並一併解讀。在這裡,你將學會使用 tidyr、purrr 和 broom 套件,為每個國家擬合線性模型,並理解與比較其輸出。
當前練習
本章將帶你結合多個相關的資料集,例如把各決議案的主題資訊納入你的投票分析中。你也將學會如何把不整齊的資料轉換為整齊資料,並了解整齊資料如何引導你隨時間探索各主題與各國。