开始使用免费开始使用

不止于词:分词(3)

ft_tokenizer() 通过按空格拆分文本来生成词语,方法较为简单。若要更高级的用法,您可以使用正则表达式来拆分文本数据。这可通过 ft_regex_tokenizer() 函数完成。它与 ft_tokenizer() 的用法相同,但多了一个用于分隔符的 pattern 参数。

a_tibble %>%
  ft_regex_tokenizer("x", "y", pattern = regex_pattern)

ft_regex_tokenizer() 的返回值与 ft_tokenizer() 一样,都是字符向量列表的列表。

数据集中有一个名为 artist_mbid 的字段,包含艺术家在 MusicBrainz(一个音乐元数据百科网站)上的 ID。ID 由十六进制数字组成,并以连字符分隔,例如 65b785d9-499f-48e6-9063-3a1fd1bd488d

本练习是课程的一部分

R 中使用 sparklyr 的 Spark 入门

查看课程

练习说明

  • track_metadata_tbl 中选择 artist_mbid 字段。
  • 将 MusicBrainz 的 ID 拆分为十六进制数字块。
    • 调用 ft_regex_tokenizer()
    • 输出列应命名为 artist_mbid_chunks
    • pattern 参数中使用连字符 -

交互式实操练习

通过完成这段示例代码来试试这个练习。

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Select artist_mbid column
  ___ %>%
  # Split it by hyphens
  ___
编辑并运行代码