【问题标题】:transfer documents to vector space representation, how to generate the dictionary?将文档转移到向量空间表示,如何生成字典?
【发布时间】:2015-07-06 09:14:39
【问题描述】:

我有大量的非结构化文本文档,对于每个文档,我想要一个向量空间表示,这样我就可以轻松地将文档分类为集群并进行语义分析。将文档转移到向量空间的方法有很多,例如词袋(BOW)模型、潜在语义分析(LSA)、n gram 模型等。但是我认为他们都需要一个Dictionary for the keywords.(不确定)但是如果没有查询,如何为大量文档生成Dictionary?(100万)如何确定文档中的重要单词?

【问题讨论】:

    标签: machine-learning nlp


    【解决方案1】:

    您可以使用简单的频率模型来确定哪些词很重要并且需要包含在您的字典或词典中。该模型假设总计数较低(低于某个阈值)的词不重要,可以安全地排除。

    你可以从一个非常大的字典开始,使用一个简单的频率模型,然后使用信息增益、互信息、卡方等特征选择方法来进一步减小你的字典的大小(参见“A comparison study on文本分类中的特征选择”,作者:Yang 和 Pedersen,了解有关特征选择方法的更多信息)。

    【讨论】:

      猜你喜欢
      • 2012-12-09
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-12-15
      • 2021-04-12
      • 2013-01-31
      • 1970-01-01
      相关资源
      最近更新 更多