【问题标题】:Extract text content from Tika without specifying the file header从 Tika 中提取文本内容而不指定文件头
【发布时间】:2015-06-02 11:59:09
【问题描述】:

有没有办法使用 Tika 服务器从文件中提取内容而无需明确定义标头?例如对于一个名为“file.pdf”的特定文件,如果我这样做了

curl -X PUT --data-binary @file.pdf localhost:9998/tika --header "Content-type: application/pdf" > file.txt    

我在“file.txt”中获得了提取的内容,但如果我省略了

' --header "Content-type: application/pdf" ' 

我得到一个空的“file.txt”。

一般来说,有没有一种方法可以自动化将文档提交到 tika 服务器并使用单个命令提取 txt 中的内容的过程?

或者,我如何使用管道将文件的可能 Tika 标头输出答案重定向到此问题开头的命令?

非常感谢社区!

【问题讨论】:

  • 您使用的是哪个版本的 Apache Tika? Tika 通常会为您自动检测文件类型...

标签: apache-tika


【解决方案1】:

您错误地调用了 Tika 服务器以获得自动检测。正如Tika Server wiki page 中所详述的那样,要从任何文件(包括 PDF)中提取纯文本,您应该将 Curl 运行为:

curl -T file.pdf http://localhost:9998/tika --header "Accept: text/plain"

您需要一个接受标头来告诉 Tika 您希望结果采用哪种格式(纯文本或 HTML 用于文本提取,更多格式可用于元数据)。只要您直接使用-T 选项发送文件,就会自动为您检测其类型

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-03
    • 2017-03-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-01-06
    相关资源
    最近更新 更多