【发布时间】:2021-06-21 14:21:54
【问题描述】:
我偶尔会将网站上的教程保存为 PDF 文件以供将来参考。
我目前的手动工作流程是:
- 点击“在一页上显示”链接以获取文章的完整单页视图。
- 打开浏览器的DevTools,在inspect功能的帮助下选择带有广告和相关链接的部分并将其删除。
- 将页面打印为 PDF 文件。
我为此使用了 Firefox 或 Chrome-浏览器,因为它们都具有所需的功能并且在这方面的行为非常相似。
我注意到我想要删除的内容以得到“干净打印”的内容大部分是相同的:假设所有添加都嵌入了一个具有 add-banner 类的 div。
有没有办法自动执行这些步骤?
一个想法是加载我需要专门为网站准备的自定义 CSS 文件。像.add-banner { display: none; } 这样的简单规则可以让我隐藏不想打印的部分。
我还研究了基于控制台的爬虫,因为我喜欢使用 URL 作为参数调用命令的想法。但我发现的工具是基于图像的,我想要一个可索引的 PDF 文件,我可以在其中搜索文本和选择部分。
实现这一目标的最佳选择是什么?
【问题讨论】:
-
如果内容的所有者希望您能够重新命名它,他们会创建一个 api 或提要来做到这一点。
标签: html css pdf web-scraping printing