【问题标题】:How to filter documents in a tm corpus in R based on metadata?如何根据元数据过滤 R 中 tm 语料库中的文档?
【发布时间】:2016-07-12 13:08:43
【问题描述】:

我正在使用 R tm 包,我正在尝试通过索引和元数据选择某些文档:

orbit_corpus<-Corpus( tm_corpus, readerControl = list(reader=myReader))

meta(my_corpus[[1]])

author  : a8
origin  : Department 
heading : WhiB
id      : 1
year    : 2013

我想查找我的语料库中 2013 年发表的前一百个文档中的所有文档。 这可以确定文档 1 的元数据“年份”是否为 2013 年。

meta(my_corpus[[1]],"year") == 2013
[1] TRUE

我需要一些东西,让我可以选择在前 100 个符合标准的所有索引中进行查找。 我会想象类似的事情(但它不起作用,不幸的是也可能不会生成文档列表)。

meta(orbit_corpus[[1:100]],"year") == 2013
Error in x$content[[i]] : recursive indexing failed at level 4

非常感谢您的帮助!

【问题讨论】:

    标签: r metadata text-mining tm corpus


    【解决方案1】:

    您可以在语料库的前 100 个文档中使用 tm_filter (orbit_corpus[1:100])

    tm_filter(orbit_corpus[1:100], FUN = function(x) meta(x)[["year"]] == "2013")
    

    来自文档

    tm_filter 返回包含 FUN 匹配的文档的语料库

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-03-26
      • 2023-04-08
      • 1970-01-01
      • 2020-10-28
      • 1970-01-01
      • 1970-01-01
      • 2013-08-11
      相关资源
      最近更新 更多