【发布时间】:2021-04-27 22:28:35
【问题描述】:
我正在尝试提取 PDF 的内容以获得等效的 HTML。
我正在使用 Nodejs 来执行此操作(它是一个电报机器人)。
我用谷歌搜索了一段时间,我只能找到 HTML 到 PDF 的东西,比如使用 poppetteer 和类似的东西。你知道做完全相反的事情吗?
Ty 提前。
【问题讨论】:
-
为什么提取内容对您很重要?之后你如何处理 HTML?对于典型的 PDF,没有语义信息(没有表格、没有句子、没有标题等)
-
目标是从pdf创建一个epub(基本上是一个html页面)
-
您是否在寻找固定布局的 EPUB,它看起来与 PDF 源相同?或者你想要可重排的 HTML?
-
Nono,如果我必须编写实际的 html 也没关系(对于原型,我将
用于内容,一些
用于标题
-
我不关注。也许您可以更新您的问题,让每个人都更深入地了解您要完成的工作(要求+目标)。
标签: javascript html node.js pdf telegram