【发布时间】:2018-02-16 15:59:57
【问题描述】:
我有一个包含 10 个文档的 Quanteda 语料库,其中几个是同一作者的。我将作者存储在单独的 docvar 列中 - myCorpus$documents[,"author"]
> docvars(myCorpus)
author
206035 author1
269823 author2
304225 author1
422364 author2
<...snip..>
我正在绘制Lexical Dispersion Plot with xplot_xray,
textplot_xray(
kwic(myCorpus, "image"),
kwic(myCorpus, "one"),
kwic(myCorpus, "like"),
kwic(myCorpusus, "time"),
kwic(myCorpus, "just"),
scale = "absolute"
)
如何使用myCorpus$documents[,"author"] 作为文档标识符而不是文档 ID?
我不想对文档进行分组,我只是想通过作者来识别文档。我认识到文档 ID 需要是唯一的,因此不能简单地用 docnames(myCorpus)<- 重命名文档
【问题讨论】:
-
最好使用
docvars(myCorpus, "author"),因为直接访问对象内部可能不适用于未来的版本。
标签: r plot corpus lexical quanteda