【发布时间】:2017-04-04 13:31:53
【问题描述】:
我创建了文本语义搜索引擎。但是,我找不到标记的数据集,以便我可以评估我的系统的信息检索。
是否有任何公开的可用文档(文本)被标记。因为我需要文本文档来评估信息检索结果。 (召回率、精度、F1 值...)
谢谢。
【问题讨论】:
标签: semantic-web information-retrieval
我创建了文本语义搜索引擎。但是,我找不到标记的数据集,以便我可以评估我的系统的信息检索。
是否有任何公开的可用文档(文本)被标记。因为我需要文本文档来评估信息检索结果。 (召回率、精度、F1 值...)
谢谢。
【问题讨论】:
标签: semantic-web information-retrieval
我在这个方向进行研究。在我所有的研究中,我都使用了AOL dataset,它包含在三个月内(2006 年 3 月 1 日至 2006 年 5 月 31 日)从约 65 万用户收集的约 20M 网络查询。数据按匿名用户ID排序,按顺序排列。
数据集包括{AnonID, Query, QueryTime, ItemRank, ClickURL}。可以在上面提到的链接中找到更多详细信息。我很想知道你是如何实现的,如果可能的话,分享你的引擎代码。我也有兴趣了解 AOL 数据集在您的搜索引擎中的表现。
您可以在我的git repository 中找到数据集。谢谢!
【讨论】: