【问题标题】:storing a scanned (pdf,tiff,jpeg) file in MongoDB .在 MongoDB 中存储扫描的 (pdf,tiff,jpeg) 文件。
【发布时间】:2017-04-26 07:49:51
【问题描述】:

我必须在 mongodb 中存储一个 tiff(标记图像文件格式)或 pdf 扫描文件,该文件应该可以进行文本搜索。就像我们想“基于文本”搜索它应该能够搜索。

我将使用 .net mvc 或 java 和 mongodb 。

那么我怎样才能存储这个 pdf 文件,然后可以从数据库中检索。

任何建议将不胜感激。

谢谢

【问题讨论】:

    标签: mongodb mongodb-query mongodb-.net-driver spring-data-mongodb


    【解决方案1】:

    我认为您应该将文件保存在服务器的文件系统上以及文件的路径和MongoDB内部文件中的字符串, 从服务器文件系统读取文件比从 MongoDB 加载文件效率更高。

    另一种选择是将文件保存为二进制数据,但您将无法在文件中进行搜索。

    【讨论】:

    • 好的。但是如果我按照您上面提到的第一种方式,我可以在文件中搜索吗?主要目的是在文件中搜索。
    • 如果这是带有文本的 pdf,您应该提取所有文本并单独保存,tiff 和图像您必须进行 OCR 并单独处理它们以提取您将制作的所有文本搜索查询。
    【解决方案2】:

    您可以使用 this question 中描述的 MongoDb GridFs 存储文件,并使用 this question 中描述的一些功能从 PDF 文件中提取文本。 ;)。

    HTH

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-08-11
      • 1970-01-01
      相关资源
      最近更新 更多