【发布时间】:2012-06-29 15:54:27
【问题描述】:
我正在尝试解析 docx 文件夹并根据某个单词是否加粗来获取特定元素。如果这是文档中的文本:
Foo:你好
嘘: 呸呸呸
•废话
•废话
Choo:你好
我想逐行扫描,然后取出粗体字之后的所有文本,直到下一个粗体字。
截至目前,我正在使用基于换行符进行解析的 XML 解析器。我在 Zipfile 中找不到任何东西,也找不到任何可以给我这样的元数据的行。
可以这样做吗?
【问题讨论】:
-
您不是在寻找“在 Python 中使用格式化进行文件解析”,而是在寻找“在 Python 中的 Docx 内容和格式提取”或类似的东西。你看python-docx了吗?
标签: python file-io xml-parsing fileparsing