【发布时间】:2020-05-24 13:10:47
【问题描述】:
例如,我有一个数据数组,其中一些文本描述如下:
大泳池房
1层仓库
多个存储池
现在,我想根据子字符串对文本描述进行编码。例如,如果文本中有字符串“pool”,那么我想为整个文本描述分配一个数字代码(例如,101)。
如果文本描述中有多个字符串(例如“存储”和“池”),那么我想为这些描述分配多个代码并连接/粘贴这些代码。例如,在描述的情况下 - “多个存储池”,我会将代码(例如,102)分配给存储,将 101 分配给池。所以,结果应该是 (102, 101)。
谁能为此推荐一个 R 算法?
【问题讨论】:
-
在 R 的
keras包中,有一个text_tokenizer函数,它可以适合文本体以生成某些标记(通常是单词)的数字表示。然后,您可以使用texts_to_sequences生成您提到的数字序列。示例见此处:jjallaire.github.io/deep-learning-with-r-notebooks/notebooks/… -
Soundex?例如,参见
?stringdist::stringdist。但这很大程度上是基于意见的,是投票结束的理由。 (我还没有,至少现在还没有)你能展示你尝试过的东西吗? -
@Valeri Voev, @ Rui Barradas -- 非常感谢
标签: r string multidimensional-array text