【问题标题】:Get text from doc/docx file in pages using Apache tika使用 Apache tika 从页面中的 doc/docx 文件中获取文本
【发布时间】:2015-05-21 11:05:11
【问题描述】:

我正在使用 apache tika 命令行工具从 doc 和 docx 文件中提取文本。我可以获取整个文本,但我无法以页面的形式获取它们,以便我可以单独存储每个页面。有没有办法做到这一点?

【问题讨论】:

  • 您知道 Microsoft Word 文件格式是基于运行而不是基于页面的吗?

标签: apache-tika


【解决方案1】:

Tika 使用 Apache POI 处理 Word 文件(旧的二进制文件和新的基于 XML 的文件)。

由于 POI(基本上)无法读取这些页码,而且 Tika 也不是文档渲染器,因此答案非常简单:不,这是不可能的

要更深入地了解为什么您的要求(从技术角度)没有多大意义,请参阅我的回答 here

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-12-08
    • 1970-01-01
    • 2015-10-06
    • 2011-07-29
    • 1970-01-01
    • 1970-01-01
    • 2018-01-06
    相关资源
    最近更新 更多