【发布时间】:2016-11-02 01:29:59
【问题描述】:
在this post @mikemaccana 中描述了如何使用python-docx 从python 中的MS Word 文档中提取原始文本数据。我想更进一步。除了简单地提取原始文本信息之外,我还可以使用此模块来获取有关字体(例如粗体与斜体)或字体大小(例如 12 与 18pt)的信息。我最接近的是this post 询问使用此模块提取突出显示的文本条目。
似乎有点抽象,我不完全确定这里发生了什么。有没有更直接的方法从 python 中的 Word 文档中提取格式信息?通过快速文档模板:
这里的第一行是一个带有一个句子的大标题。
第二行略小。它也有两个句子。
甚至更小。但这还不是全部。这一行有三句话。
最后,这是一行常规的非粗体文本。
如果我们将这四行称为我的 word 文档,我想编写一个解析函数,称之为 doc_parser,它返回如下内容类似:
>>>> doc_data = doc_parser(path_to_example_doc)
>>>> print(doc_data)
[1] [{'font': 18, 'face': 'bold', 'n_sentence': 1},
{'font': 16, 'face': 'bold', 'n_sentence': 2},
{'font': 14, 'face': 'bold', 'n_sentence': 3},
{'font': 12, 'face': 'plain', 'n_sentence': 1}]
【问题讨论】:
标签: python ms-word python-docx