【发布时间】:2015-05-21 11:05:11
【问题描述】:
我正在使用 apache tika 命令行工具从 doc 和 docx 文件中提取文本。我可以获取整个文本,但我无法以页面的形式获取它们,以便我可以单独存储每个页面。有没有办法做到这一点?
【问题讨论】:
-
您知道 Microsoft Word 文件格式是基于运行而不是基于页面的吗?
标签: apache-tika
我正在使用 apache tika 命令行工具从 doc 和 docx 文件中提取文本。我可以获取整个文本,但我无法以页面的形式获取它们,以便我可以单独存储每个页面。有没有办法做到这一点?
【问题讨论】:
标签: apache-tika
Tika 使用 Apache POI 处理 Word 文件(旧的二进制文件和新的基于 XML 的文件)。
由于 POI(基本上)无法读取这些页码,而且 Tika 也不是文档渲染器,因此答案非常简单:不,这是不可能的。
要更深入地了解为什么您的要求(从技术角度)没有多大意义,请参阅我的回答 here。
【讨论】: