【发布时间】:2010-11-18 06:50:06
【问题描述】:
很常见的情况,我敢打赌。你有一个博客或新闻网站,你有很多文章或博客或任何你称之为的东西,你想在每一个的底部推荐其他似乎相关的内容。
让我们假设每个项目的元数据很少。也就是说,没有标签、类别。视为一大块文本,包括标题和作者姓名。
你如何寻找可能相关的文件?
我对实际算法很感兴趣,而不是现成的解决方案,尽管我可以看看用 ruby 或 python 实现的东西,或者依赖 mysql 或 pgsql。
编辑:目前的答案非常好,但我希望看到更多。也许是一两件事的一些非常简单的示例代码。
【问题讨论】:
-
我变成了一个糟糕的标注员。非常欢迎标签编辑。
-
查看竞赛.github.com 以获取针对类似问题的大量开源解决方案。
-
好了,添加了完整的 Ruby 示例。
标签: text machine-learning information-retrieval document-classification