【问题标题】:Scraping words within a string from websites从网站中抓取字符串中的单词
【发布时间】:2020-06-09 06:42:58
【问题描述】:

我对scrapy 和Python 还是很陌生。我正在制作一个网络抓取工具,试图从他们网站的 HTML 文本中抓取企业主的姓名。我的问题是我不能完全使用 xpath 或 css 响应从网站代码中获取文本,因为我正在抓取数百个具有不同编码、类、页面等的不同网站。这是我到目前为止所拥有的:

html_text = str(response.text)
owner_name=re.findall("owner", html_text)
    if owner_name:
        print("OWNER FOUND @ " + str(response.url))

显然,所有这一切确实是让我知道程序是否找到了提及所有者的页面。我不太确定如何从 html 代码中抓取他们的名字。我假设他们的名字会立即跟随在 HTML 中提到所有者的任何地方,所以我实际上是在尝试在所有者一词之后刮下一个或两个词。

【问题讨论】:

标签: python web-scraping scrapy


【解决方案1】:

也许您想使用字符串find 方法来获取子字符串所有者的位置,然后slice 字符串。

>>> string = "a lot of filler text and the owner is john doe"
>>> i = string.find("owner")
>>> print(string[i:i+30])
owner is john doe

【讨论】:

    猜你喜欢
    • 2021-11-02
    • 1970-01-01
    • 2021-10-28
    • 2019-08-06
    • 1970-01-01
    • 1970-01-01
    • 2011-11-29
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多