【问题标题】:docsplit conversion to PDF mangles non-ASCII characters in docx on Linuxdocsplit 转换为 PDF 会破坏 Linux 上 docx 中的非 ASCII 字符
【发布时间】:2013-10-17 13:54:55
【问题描述】:

我的文档管理应用程序涉及使用 docsplit 将包含非 ASCII Unicode 字符(日语)的 .docx 文件转换为 PDF(通过 Ruby gem,如果重要的话)。它在我的 Mac 上运行良好。在我的 Ubuntu 机器上,无论是通过 Ruby 调用还是直接在命令行上调用,生成的 PDF 都有字符所在的方框。奇怪的是,当我直接在 LibreOffice 中打开 .docx 文件并进行 PDF 导出时,它工作正常。因此,似乎 docsplit 如何调用 LO 在某些方面会导致 Unicode 字符处理不当。我已经搜索了文档和代码的各个部分以查找我可能需要指定的选项,但没有运气。关于为什么会发生这种情况的任何想法?

FWIW,docsplit 在pdf_extractor.rb 中使用以下选项行调用 LO:

options = "--headless --invisible  --norestore --nolockcheck --convert-to pdf --outdir #{escaped_out} #{escaped_doc}"

我注意到输出格式可以选择在pdf:output_filter_name 中后跟输出过滤器a--这是我需要考虑使用的东西吗?

【问题讨论】:

    标签: pdf libreoffice docsplit


    【解决方案1】:

    我已将此追溯到 docsplit 传递给 LibreOffice 的 --headless 选项。这会调用非 X 版本的 LO,它显然没有必要的日文字体。不幸的是,似乎没有办法将选项传递给 docsplit 来告诉它忽略 LO 的 --headless 选项,所以我最终会以某种方式修补或分叉代码。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-03-22
      • 1970-01-01
      • 2010-12-30
      • 1970-01-01
      • 2014-10-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多