【发布时间】:2014-12-11 12:31:09
【问题描述】:
我目前正在处理一个大的 .docx 文件(大约 400 页)。它被分成很容易被人类消化的部分,看起来像这样:
粗体字
书面段落
这是完美的人类可读性和伟大的。不幸的是,我们大学有一个内部程序,它使用 .docx 文件的标记来对它们进行分类/对它们进行一些处理。我的意思是仅使用粗体标记分割 .doc/.docx 是不够的,您必须使用 MS Office 中的内置工具来执行此操作(如下所示):
所以我需要编写一个简单的脚本,它会在 .docx 文档中找到粗体文本,并将该文本转换为正确标记的“标题 1”或类似内容。 .docx 文件格式是否被维护或类似的东西与我无关。
可以这样做吗?我应该开始研究哪些 API/语言/工具来完成这个相对简单的任务?
【问题讨论】:
-
请举例说明您希望这个“第 1 章”善...”的结果如何?
标签: windows parsing ms-word ms-office doc