【发布时间】:2013-02-13 21:28:13
【问题描述】:
我有最常用词的列表,这些词来自 Google 公开的 ngram 数据。
我有:
6800 频繁2克 4800频繁3克 2500频繁4克 1100频繁5克
一个示例 2 ngram 将类似于:
“狗” “一本书” “三把椅子” 等等
一个示例 5 ngram 将类似于: “曾几何时那里” “曾几何时” “天黑了,” 等等
我还有一个包含 2000 个常用词的列表。
1) 我想找出我的各种列表中最少 ngram 的哪个组合包含频繁单词列表中最多的单词。
例如,如果我发现 200 个 2 克、40 个 3 克、50 个 4 克和 20 个 5 克使用了 1800 个常用词,那将是成功的。我把这些比率做了起来,但我想找到少于 500 个使用大部分单词的组合。
2) 我还想从列表中找到包含最多单词的各种 ngram 的最小组合。
例如,如果我能找到 500 个使用超过 2000 个不同单词的 ngram,那就太好了。
我遇到的问题是我不知道该怎么做。我认为 hadoop 和 mapreduce 的方向是正确的......但任何帮助将不胜感激!
【问题讨论】:
-
@Jeremy,您能告诉我们您在 CS 方面的背景吗?
-
@AlptiginJalayr 我对 PHP、JavaScript 和 MySQL 很有信心……但以前从未尝试过像这样的机器学习。这可能有点出乎我的意料,但我希望至少尝试了解解决问题所涉及的技术。
标签: algorithm optimization set-cover