【发布时间】:2009-11-20 03:01:10
【问题描述】:
我在如何对文件进行单元测试时有点挣扎...假设我有一个包含 25 列的文件,其长度可能在 20 到 1000 条记录之间...我该如何编写针对那?该函数将文件作为字符串作为参数,并返回带有文件内容的DataTable...
我能想到的最好的办法是解析一个 4 记录文件,只检查左上角和右下角的“角落”......例如2 个顶部记录中的前几个字段和 2 个底部记录的最后几个字段......我无法想象必须为文件中的每个字段繁琐地手动键入断言语句。而且只做一个记录,每个字段看起来都一样弱,因为它没有考虑到多个记录文件或意外数据的情况。
当时这似乎“足够好”......但是现在我正在开发一个新项目,该项目本质上是解析来自 10 个不同来源的各种 PDF 文件,每个来源都有 4-6 种不同的格式他们的文件,所以大约有 40-60 个解析例程。我们最终可能会在未来完全自动化 25 个额外的资源。我们获取 PDF 并使用 3rd 方工具将其转换为 excel。然后我们坐下来分析输出中的模式,编写调用工具 API 的代码,获取 excel 文件并对其进行解析 - 剥离垃圾,对不同地方的数据进行排序,清理等等。
我如何对这样的东西进行单元测试?
【问题讨论】:
标签: unit-testing pdf parsing