【发布时间】:2014-10-10 10:34:50
【问题描述】:
对于我的论文,我正在尝试使用带有文本挖掘扩展的 RapidMiner 社区版对较大(最多 2GB)的文本文档(产品评论)进行情感分析。
我想为此生成二元组。但是对于一个甚至没有 100.000 个文档的 70MB 小 csv 文件,在 8 核 32GB RAM 机器上生成二元组已经需要 12 个小时(RapidMiner 配置为使用 28GB 和所有内核)。
我已经能够使用过滤器将它减少到 3 个小时,但它的缺点是具有原始文档中不存在的二元组。我不确定,如果这是我能做到的。
我目前的流程是这样的:
Read CSV -> Process documents (Tokenize -> Stem -> Filter stop words -> Filter length < 2 -> Generate n-grams ) -> Split Validation
删除 n-gram 运算符会使精度和召回率下降到约 60%,这远远不能接受。感谢您提供任何想法,如何加快速度。
【问题讨论】: