or
この演習はコースの一部です
正規表現は特殊文字が多く、最初は圧倒されがちです。この章では、それらを読み解き、探したいものを的確に見つけるための自分だけのパターンを書けるようになります。
現在の演習
この章では正規表現から少し離れて、ベクトルやリストといった他のデータ構造から文字列を作る、文字列操作に焦点を当てます。
正規表現が真価を発揮するタスクのひとつは、テキストの塊から意味を取り出すことです。この章では、整然とした表ではなくプレーンテキストで与えられた乱雑なデータから、情報を抽出する方法を学びます。
最後の章では、正規表現から離れて文字列距離の理解にシフトします。複数の文字列の違いを計算することで、互いに似ているものを突き止められます。これにより、誤字のような小さなエラーがあっても重複を発見できます。これは、複数のソースからデータセットを統合するレコードリンケージの重要な要素です。