Hledání shod na základě dvou podmínek
V tomto cvičení propojíš 2 datasety s odpovídajícími názvy filmů, které ale obsahují překlepy. V první tabulce movie_titles je deset filmů, které máš spárovat s druhou tabulkou movie_db. Obě tabulky pocházejí ze skenovaných dokumentů a obsahují chyby vzniklé softwarem pro optické rozpoznávání znaků (OCR).
Obě tabulky obsahují sloupce title a year. Použij je k nalezení shod.
Vytvoř 2 pomocné funkce, které identifikují podobné nebo shodné záznamy. Jednu pro názvy filmů (na základě stringdist()) a druhou pro porovnávání roků pomocí abs() (která vrací absolutní hodnotu rozdílu).
Toto cvičení je součástí kurzu
Intermediate Regular Expressions in R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate the string distance - it should be smaller than 3
is_string_distance_below_three <- function(left, right) {
___(left, right) < ___
}
is_string_distance_below_three("Hi there", "Hi there")