各種字串距離方法的結果可能差異很大。有的方法算出的數值會小於 1,但另一些可能大於 10。因此,了解每種方法的運作原理很重要。
你已經看過 6 種方法,其中有 3 種採用「編輯距離」的做法,也就是計算把第一個字串轉換成第二個字串所需的編輯次數。
另外 3 種的作法不同:會把字串切成固定長度的子字串,也就是所謂的 q-gram(有時也稱為 n-gram)。你還記得哪些方法是這一類嗎?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
Regular Expressions 一開始看起來可能很嚇人,因為牽涉到大量特殊字元。本章會帶你逐步拆解這些元素,並撰寫自己的樣式,精準找到你想要的內容。
本章我們會稍微脫離 Regular Expressions,專注在字串操作,學習如何從向量或列表等其他資料結構建立字串。
Regular Expressions 的強項之一,是能從一大段文字中理出頭緒。本章你會學到如何從雜亂、非表格化而是純文字的資料中,擷取出有用的資訊。
最後一章,我們將把重點從 Regular Expressions 轉到字串距離。透過計算多個字串之間的差異,我們可以配對出彼此相似的字串。這有助於在存在小錯誤(例如打字錯誤)時,依然找出重複項。這也是 record linkage 的重要一環,當我們要整合來自多個來源的資料集時尤其關鍵。
當前練習