【问题标题】:Text files to test the functionality of a search engine用于测试搜索引擎功能的文本文件
【发布时间】:2011-12-17 20:45:16
【问题描述】:

为了练习即将到来的编程比赛,我正在用 C# 制作一个非常基本的搜索引擎,它接受来自用户的查询(例如 "Markov Decision Process")并搜索一对文件以找到与查询最相关的文件。

该应用程序似乎正在运行(我使用了术语文档矩阵算法)。

但现在我想测试一下搜索引擎的功能,看看它是否真的正常工作。我尝试获取几篇 Wikipedia 文章并将它们保存为 .txt 文件并对其进行测试,但我只是看不出它是否运行得足够快(即使有一些计时器)。

我的问题是,是否有一个网站显示几个文件来测试搜索引擎(以及逻辑上预期的结果)?

到目前为止,我正在用常识进行测试,但如果能确定我的结果,那就太好了。

另外,我如何获得关于各种主题的 .txt 文件(可能超过 10 000 个文件)的集合,以查看我的应用程序运行速度是否足够快?

我尝试复制一些 Wikipedia 文章,但这样做会花费方式太多时间。我也想过制作某种脚本来为我做这件事,但我真的不知道该怎么做。

那么,我在哪里可以找到很多不同主题的文件?

否则,如何对我的应用程序进行基准测试?

注意:我猜一个简单的大 .txt 文件,其中每一行代表一个关于某个主题的“文件”也可以完成这项工作。

【问题讨论】:

  • 随意更改标签以获得更好的标签,我不知道哪些适合哪些不适合......
  • 我不确定很多人会费心制作一个包含 10000 个主题的文本文件,或者费心上传 10000 个不同的文件
  • @annonymously:哦,我当然不是要那个!我正在寻求一种方法来使用某种脚本获取这些文件,以从维基百科获取随机文章并将它们保存在本地,也许?我不知道如何继续获取这些文件或只是对我的应用程序进行基准测试,所以这就是我要问的:我该怎么做?
  • 如果您只需要大量随机文本,中间包含一些信息,您可以制作一个脚本来复制大量维基百科页面的 html 源代码。
  • @annonymously:哦,我喜欢这个主意!我可以从哪里开始学习如何制作这样的脚本?

标签: c# file search scripting search-engine


【解决方案1】:

文本文件的一个来源是Project Gutenberg。如果您想一次下载数千个文件,他们会提供CD/DVD images。 (该页面没有说明,但我想它们是 CD/DVD iso 中的 txt 格式。)

【讨论】:

    【解决方案2】:

    您可以通过使用递归函数并从由一组页面链接到的每个页面加载 html 来获取维基百科页面。

    如果您对 c# 有一定的经验,这应该会对您有所帮助: http://www.csharp-station.com/HowTo/HttpWebFetch.aspx

    然后循环遍历文本并收集文本的所有实例:"<a href=\"" 并递归调用该方法。您还应该使用计数器来限制递归次数。

    此外,为了防止 OutOfMemory 异常,您应该在该方法达到某些迭代次数的倍数时停止该方法,并将所有内容写入文件。然后从字符串中刷新旧数据

    【讨论】:

      【解决方案3】:

      您可以使用来自GroupLens Research 网站的数据集。

      部分样本:moviesbooks

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2013-09-28
        • 1970-01-01
        • 1970-01-01
        • 2011-04-03
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多