【问题标题】:Docx content and formatting extraction in pythonpython中的Docx内容和格式提取
【发布时间】:2012-06-29 15:54:27
【问题描述】:

我正在尝试解析 docx 文件夹并根据某个单词是否加粗来获取特定元素。如果这是文档中的文本:

Foo:你好

嘘: 呸呸呸

•废话

•废话

Choo:你好

我想逐行扫描,然后取出粗体字之后的所有文本,直到下一个粗体字。

截至目前,我正在使用基于换行符进行解析的 XML 解析器。我在 Zipfile 中找不到任何东西,也找不到任何可以给我这样的元数据的行。

可以这样做吗?

【问题讨论】:

  • 您不是在寻找“在 Python 中使用格式化进行文件解析”,而是在寻找“在 Python 中的 Docx 内容和格式提取”或类似的东西。你看python-docx了吗?

标签: python file-io xml-parsing fileparsing


【解决方案1】:

我会使用支持读取 docx 文件而不是解析 XML 文档的更高级别的库。

查找任务的库是python-docx

如果您使用的是 Jython,Apache POI HWPF 是另一种选择。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-04-17
    • 1970-01-01
    • 2013-06-16
    • 1970-01-01
    • 2018-08-11
    相关资源
    最近更新 更多