【发布时间】:2015-05-28 05:19:55
【问题描述】:
我想将 PDF 上传到 MarkLogic 数据库并在其上构建搜索引擎。 能给点建议吗?
【问题讨论】:
我想将 PDF 上传到 MarkLogic 数据库并在其上构建搜索引擎。 能给点建议吗?
【问题讨论】:
这可以轻松完成。实际上,它是预制的示例应用程序之一:http://developer.marklogic.com/code/document-discovery
自 MarkLogic 8 以来,该示例应用程序的技术堆栈有点过时,但使用 https://github.com/marklogic/marklogic-samplestack 或 https://github.com/marklogic/slush-marklogic-node 使用更现代的堆栈重新创建它并不难。
后者实际上带有一个示例转换,可与 /v1/documents 上的 PUT 调用一起使用,以获取从二进制文档(如 PDF)中抓取的文本和元数据:
文档过滤支持多种二进制格式:http://docs.marklogic.com/guide/search-dev/binary-document-metadata#id_68368
HTH!
【讨论】: