【发布时间】:2022-02-14 00:49:59
【问题描述】:
我有一个使用 Node JS 进行网页抓取的项目,我将不得不从主要内容中抓取标题和文本。但问题是当没有aside 或main 标签或名为aside 或main 的类/id/角色时,我无法确定哪个是主要内容。我正在使用 Puppeteer 和 Cheerio 库。我试过使用 Mercury Web Parser 但它有自己的问题。 Like It 不会从 Wordpress 上使用 Elementor Theme 构建器构建的页面返回任何内容。如果有人知道如何区分主要内容和网页的其余部分,那将非常有帮助。
【问题讨论】:
-
请提供更多详细信息,例如 URL 或 HTML 源代码
标签: javascript node.js web-scraping puppeteer cheerio