【问题标题】:PDF to HTML in a nodejs applicationnodejs应用程序中的PDF到HTML
【发布时间】:2021-04-27 22:28:35
【问题描述】:

我正在尝试提取 PDF 的内容以获得等效的 HTML。

我正在使用 Nodejs 来执行此操作(它是一个电报机器人)。

我用谷歌搜索了一段时间,我只能找到 HTML 到 PDF 的东西,比如使用 poppetteer 和类似的东西。你知道做完全相反的事情吗?

Ty 提前。

【问题讨论】:

  • 为什么提取内容对您很重要?之后你如何处理 HTML?对于典型的 PDF,没有语义信息(没有表格、没有句子、没有标题等)
  • 目标是从pdf创建一个epub(基本上是一个html页面)
  • 您是否在寻找固定布局的 EPUB,它看起来与 PDF 源相同?或者你想要可重排的 HTML?
  • Nono,如果我必须编写实际的 html 也没关系(对于原型,我将

    用于内容,一些

    用于标题

  • 我不关注。也许您可以更新您的问题,让每个人都更深入地了解您要完成的工作(要求+目标)。

标签: javascript html node.js pdf telegram


【解决方案1】:

看看pdfjs-dist

我没有使用过那个库,但它似乎可以让你更接近你的目标。此外,您可能已经知道,PDF 可以包含任何内容:扫描的文本、照片、绘图等等。

拥有一个能够提取人类可以从 PDF 中提取的所有信息的库可能是不可能的。

【讨论】:

  • 大部分时间我只会“扫描”文本,也许还有一些图像,而不是更多。我去看看,谢谢!
  • PDF.js 是一个 PDF 到 HTML5 画布查看器。它如何“提取PDF的内容以获得等效的HTML”?
  • 我尝试使用它,但它非常“愚蠢”,对于某些 pdf,它会逐个字母地提取,对于另一些 pdf,它会提取格式良好的单词,但它不是“确定性的”,而且很难处理
  • 这很可能是因为 PDF 图形操作是如何写入您正在测试的特定文件中的。 PDF 是一种即时模式图形引擎,如 OpenGL,而不是像 HTML/SVG 那样的 DOM。所以很可能 PDF.js 正在提取文本,因为它完全写入图形流中。
猜你喜欢
  • 2021-01-07
  • 2022-10-14
  • 2022-06-21
  • 1970-01-01
  • 1970-01-01
  • 2010-10-17
  • 2020-12-01
  • 1970-01-01
  • 2018-02-15
相关资源
最近更新 更多