不止于词:分词(3)
ft_tokenizer() 通过按空格拆分文本来生成词语,方法较为简单。若要更高级的用法,您可以使用正则表达式来拆分文本数据。这可通过 ft_regex_tokenizer() 函数完成。它与 ft_tokenizer() 的用法相同,但多了一个用于分隔符的 pattern 参数。
a_tibble %>%
ft_regex_tokenizer("x", "y", pattern = regex_pattern)
ft_regex_tokenizer() 的返回值与 ft_tokenizer() 一样,都是字符向量列表的列表。
数据集中有一个名为 artist_mbid 的字段,包含艺术家在 MusicBrainz(一个音乐元数据百科网站)上的 ID。ID 由十六进制数字组成,并以连字符分隔,例如 65b785d9-499f-48e6-9063-3a1fd1bd488d。
本练习是课程的一部分
R 中使用 sparklyr 的 Spark 入门
练习说明
- 从
track_metadata_tbl中选择artist_mbid字段。 - 将 MusicBrainz 的 ID 拆分为十六进制数字块。
- 调用
ft_regex_tokenizer()。 - 输出列应命名为
artist_mbid_chunks。 - 在
pattern参数中使用连字符-。
- 调用
交互式实操练习
通过完成这段示例代码来试试这个练习。
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Select artist_mbid column
___ %>%
# Split it by hyphens
___