【发布时间】:2014-12-16 11:55:49
【问题描述】:
我正在使用 XSLFPowerPointExtractor 从 pptx 文件中提取文本。但是,pptx 文件中的所有文本都以单个字符串的形式返回给我。无论如何我可以分别获取每张幻灯片上的文字吗?我对这个概念完全陌生,所以请给出详细的答案..
【问题讨论】:
-
你研究过 apache poi 吗?
-
是的,powerpointextractor 是 POI 包的一个类。它只是给了我 getText() 选项,它将文件的全部内容作为字符串返回。
-
查看返回字符串的格式了吗?我会假设幻灯片会以某种方式分隔,您可以在分隔符上拆分字符串。
-
我做到了,没有办法将一张幻灯片与另一张分开。它都是一个长字符串。
标签: java apache-poi text-extraction