【发布时间】:2015-09-03 13:59:38
【问题描述】:
我需要开发一个代码,用于使用 NLTK 在大型 txt 语料库中计算 Ngram (1,2,3,4,5,6) 频率。我有两个问题: 1:我有以下代码批量导入文件:
from nltk.corpus import PlaintextCorpusReader
Corpus_root = 'C/x/x/Myfolder'
files = PlaintextCorpusReader(corpus_root, '.*')
files.fileids()
给我所有读入 NLTK 的文件的输出。
我的第一个问题是如何将语料库阅读器连接到即将到来的代码以计算 ngram?
下一步我的问题是我应该使用什么代码模块来计算二元组、三元组和四元组和五元组以及它们的频率,哪些是高效和快速的?
我有 300 个 txt 文件,想用它们来获取 ngram 频率。
【问题讨论】: