【问题标题】:Blocks of similar text for test data测试数据的相似文本块
【发布时间】:2009-01-06 04:57:59
【问题描述】:

出于测试目的,我需要创建具有相似但不相同文本的文本文件集。每个集合都需要与其他集合不同,但也要有一些共同点。

例如,我可能需要创建 10 组,每组 20 个文档,总共 200 个文档。每个文档大约需要 250 个单词。

如果其中一组文档是关于狗的,那么其他集合的文档应该是关于动物的,例如,这样每个集合(在本例中为动物)和一个强一组文档之间的链接(例如一组中的狗和另一组中的猫)。

文档中的单词不需要按任何特定顺序排列,也不需要在句子中或有意义。

有人知道我如何为我的单元测试生成或获取此类数据吗?

【问题讨论】:

    标签: unit-testing


    【解决方案1】:

    Project Gutenberg 获取一些文本怎么样?

    【讨论】:

    • 好主意道格 - 谢谢 - 我一直在看网络,现在正在尝试找出如何找到关于同一主题的书籍集合。
    【解决方案2】:

    我需要用于文本索引的测试数据集以基准化 solr 索引速度。 我从 github 下载了源代码作为 zip 文件。例如,这个是巨大的- https://github.com/spring-projects/spring-framework

    “下载为 zip”按钮。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-03-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-01-21
      • 2016-06-23
      相关资源
      最近更新 更多