【发布时间】:2013-07-07 18:42:58
【问题描述】:
我想在 Lucene 中索引 100 万个 html 文档。我需要在一个 Lucene 文档中索引几个 html 文件。最近,我想在搜索响应中知道原始 html 文档。
所以,例如我有:
1.home.html
2.history.html
3.about.html
4.home2.html
...
我想在同一个 Lucene 文档中索引 1、2 和 3。然后,如果我搜索任何我想知道原始文档的文本(家庭、历史或关于)。
我一直在互联网上搜索,我找到了 Lucene 有效负载。所以我一直在考虑在所有术语中索引原始文档的 url。这是一个好的解决方案吗?表现会好吗?
非常感谢您的帮助。
【问题讨论】:
-
您只存储 html 文件的名称还是 html 文件的全部内容?
-
有效负载可能提供可接受的解决方案。一个好的解决方案是将页面存储为单独的文档。为什么要在同一个文档中索引这三个页面?
-
我正在存储文档的全部内容,并且我想存储文档的名称。我已经实现了分离页面的解决方案,它运行良好,但我需要按我之前所说的分组搜索(例如:家庭、历史和关于),我发现的唯一方法是使用有效负载。
-
有效载荷和突出显示段落怎么样?可以吗?