【发布时间】:2019-10-07 17:41:28
【问题描述】:
Quanteda 中的 textstat_keyness 用于比较两个(子)语料库中 WORDS/LEMMAS 的相对频率。但我想比较词性而不是单词。然后我想绘制它。我已经能够使用 textstat_keyness 来表示单词,没问题,使用以下方法:
# compare subcorpusA v subcorpusB terms using grouping
genre <- ifelse(docvars(corpusAB, "genre") == "group", "group", "group2")
dfmat3 <- dfm(corpusAB, groups = genre)
head(tstat1 <- textstat_keyness(dfmat3, measure = "lr", sort = TRUE, correction = "williams"), 20)
tail(tstat1, 20)
head(dfmat3)
textplot_keyness(tstat1, show_reference = TRUE,
show_legend = TRUE,
n = 40,
min_count = 5, margin = 0.05,
color = c("darkblue", "gray")
, labelcolor = "gray30",
labelsize = 2,
font = NULL)
我还使用 tokens() 对语料库进行了标记,并使用 spacy_parse 进行了解析。但我无法弄清楚如何将两者联系起来。有没有办法告诉 Quanteda 在 POS 而不是 word 上运行 textstat_keyness?
【问题讨论】: