【问题标题】:I need to extract dom element of main contents in python我需要在python中提取主要内容的dom元素
【发布时间】:2014-08-14 16:54:08
【问题描述】:

我正在努力从网页中提取主要内容,而不是在 python 中删除任何类似图像的内容,但大多数库只是将文本本身或已清理的 dom 元素返回给我。

我需要 dom 元素本身包含文章的主要内容,包括图片。

有没有为此目的的图书馆?

谢谢

【问题讨论】:

    标签: python dom web-scraping web-crawler extraction


    【解决方案1】:

    如果您的意思是使用 img src="" 获取整个 dom 节点,那么我相信 beautifulsoup4 可以做到。

    http://www.crummy.com/software/BeautifulSoup/bs4/doc/

    但对于实际图像,我不知道您必须单独请求图像。

    或者您可以使用 selenium https://pypi.python.org/pypi/selenium,它将使用您的浏览器(Firefox、Chrome),因此可以做任何事情来提取网页内容

    【讨论】:

    • 我的意思是,不是提取整个 dom,而是提取仅包含文章的 dom
    • 例如,“
      文章正文在这里
      ” => “
      这里是文章正文
      "
    • 是的,你可以用beautifulsoup做到这一点,选择合适的节点,像[a = soup.find(id='article')]这样的文章,然后提取像[a.contents]这样的内容
    • 各种网页必须完全自动化....需要避免手动操作
    猜你喜欢
    • 2015-11-20
    • 1970-01-01
    • 1970-01-01
    • 2010-12-01
    • 2018-05-24
    • 2022-07-09
    • 2021-09-27
    • 1970-01-01
    • 2017-03-03
    相关资源
    最近更新 更多