【问题标题】:Get main content in a page while web scraping node js, Puppeteer, Cheerio网页抓取节点js,Puppeteer,Cheerio时获取页面中的主要内容
【发布时间】:2022-02-14 00:49:59
【问题描述】:

我有一个使用 Node JS 进行网页抓取的项目,我将不得不从主要内容中抓取标题和文本。但问题是当没有asidemain 标签或名为asidemain 的类/id/角色时,我无法确定哪个是主要内容。我正在使用 PuppeteerCheerio 库。我试过使用 Mercury Web Parser 但它有自己的问题。 Like It 不会从 Wordpress 上使用 Elementor Theme 构建器构建的页面返回任何内容。如果有人知道如何区分主要内容和网页的其余部分,那将非常有帮助。

【问题讨论】:

  • 请提供更多详细信息,例如 URL 或 HTML 源代码

标签: javascript node.js web-scraping puppeteer cheerio


【解决方案1】:

您可以从 Mozilla 签出 Readability JS 库。它们用于读者查看。

【讨论】:

    【解决方案2】:

    尝试探索更多关于 CSS 选择器和特殊性的信息。
    如果您正在抓取 Elementor,请务必对选择器使用此技巧: 对 DOM 中的所有内容使用 data-elementor-(attributename) 属性。

    const mainContent = await page.waitForElement('[data-elementor-type="wp-page"]', {visible: true, timeout: 0})
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-06-08
      • 1970-01-01
      • 1970-01-01
      • 2015-06-27
      相关资源
      最近更新 更多