【问题标题】:docx4j html conversion breaks one line into multiple span elementsdocx4j html转换将一行分成多个span元素
【发布时间】:2013-09-13 20:44:40
【问题描述】:

我对 docx4j 生成的 html 有一个小问题。在 95% 的情况下,一切正常。但是文档中有一些行,它们被转换为多个具有相同样式的跨度。例如:

我有这样一行:S44_XYZ_ABC_AABBCCDD。文档中有多行这样的行,在转换过程中,只有 1-2% 的行以错误的方式转换。这行变成:

<span style=...>S44</span>
<span style=...>_</span>
<span style=...>XYZ</span>
           ...etc.

因为,我将这些标记替换为生成的 html 字符串中的其他文本,所以这对我来说是个问题。我尝试重新格式化该行,将其删除并修改从另一个文档复制的另一个,转换正常,但没有运气。

我认为这是某种 docx 格式相关的问题,但我无法找出原因。

非常感谢您!

【问题讨论】:

    标签: html docx docx4j


    【解决方案1】:

    Word 可能已将您的文本 S44_XYZ_ABC_AABBCCDD 拆分为多次运行。

    它可以出于各种原因执行此操作,包括语法/拼写检查、不同的格式等。要了解您的情况为什么会发生这种情况,请解压缩您的 docx,然后查看 word/document.xml

    您可以运行VariablePrepare.java 来解决造成此问题的一些原因。

    【讨论】:

    • 你是对的!我检查了它们,其中一些我设法通过删除格式来纠正,但有些仍然保持这种方式,不管运行的 xml 表示是相同的。我将进一步调查,重要的是,问题出在我正在使用的文件上。谢谢!
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-10-30
    • 2016-06-20
    • 2021-03-13
    • 1970-01-01
    • 2012-08-17
    相关资源
    最近更新 更多