【发布时间】:2011-12-17 20:45:16
【问题描述】:
为了练习即将到来的编程比赛,我正在用 C# 制作一个非常基本的搜索引擎,它接受来自用户的查询(例如 "Markov Decision Process")并搜索一对文件以找到与查询最相关的文件。
该应用程序似乎正在运行(我使用了术语文档矩阵算法)。
但现在我想测试一下搜索引擎的功能,看看它是否真的正常工作。我尝试获取几篇 Wikipedia 文章并将它们保存为 .txt 文件并对其进行测试,但我只是看不出它是否运行得足够快(即使有一些计时器)。
我的问题是,是否有一个网站显示几个文件来测试搜索引擎(以及逻辑上预期的结果)?
到目前为止,我正在用常识进行测试,但如果能确定我的结果,那就太好了。
另外,我如何获得关于各种主题的 .txt 文件(可能超过 10 000 个文件)的集合,以查看我的应用程序运行速度是否足够快?
我尝试复制一些 Wikipedia 文章,但这样做会花费方式太多时间。我也想过制作某种脚本来为我做这件事,但我真的不知道该怎么做。
那么,我在哪里可以找到很多不同主题的文件?
否则,如何对我的应用程序进行基准测试?
注意:我猜一个简单的大 .txt 文件,其中每一行代表一个关于某个主题的“文件”也可以完成这项工作。
【问题讨论】:
-
随意更改标签以获得更好的标签,我不知道哪些适合哪些不适合......
-
我不确定很多人会费心制作一个包含 10000 个主题的文本文件,或者费心上传 10000 个不同的文件
-
@annonymously:哦,我当然不是要那个!我正在寻求一种方法来使用某种脚本获取这些文件,以从维基百科获取随机文章并将它们保存在本地,也许?我不知道如何继续获取这些文件或只是对我的应用程序进行基准测试,所以这就是我要问的:我该怎么做?
-
如果您只需要大量随机文本,中间包含一些信息,您可以制作一个脚本来复制大量维基百科页面的 html 源代码。
-
@annonymously:哦,我喜欢这个主意!我可以从哪里开始学习如何制作这样的脚本?
标签: c# file search scripting search-engine